EchoWM

AI工具21小时前更新 AI工具集
0 0 0

EchoWM是什么

EchoWM 是京东探索研究院对外开源的一款交互式视听世界模型。它承接了 JoyAI-Echo 在原生音视频生成方向上的技术积累,让使用者以第一人称或第三人称视角进入模型实时生成的虚拟空间,在持续走动探索的过程中,画面构图、空间位置关系、环境音效与人物语音始终保持同步,即便交互时间拉长,也不容易出现画面崩坏或声音错位的状况。换句话说,它交付的不再是一段只能被动观看的成片,而是一个可以走进去、可以随时改变行进路线的连续世界。

支撑这种体验的,是一套统一的相机意图接口与配套的世界数据引擎。在 WBench 导航类评测的 158 个盲测样例中,EchoWM 取得了 81.7 分的综合成绩,位列榜单第一。项目源码托管在 GitHub 的 jd-opensource/JoyAI-Echo 仓库,模型权重发布在 Hugging Face 的 Echo-Team/Echo-WM 页面,两者都需要自行拉取到本地才能运行。对于关注可交互场景生成的开发者而言,它把”生成一段视频”往前推进了一步,变成了”进入一个可以走动的、视听同步的连续空间”。

EchoWMEchoWM 项目托管在 GitHub 的 jd-opensource/JoyAI-Echo 仓库

EchoWM的主要功能

把 EchoWM 的能力拆开来看,它在控制方式、输出形态和一致性维持上都与传统的视频生成工具存在明显差异,主要功能可以归纳为以下几点:

  1. 键盘即操控杆的实时漫游:敲下 WASD 就能在 AI 构建的场景里前进、后退、转身或折返,整个世界会跟着你的操作实时向前延展,而不是先算好一段再播放。
  2. 视听一体的原生输出:在同一个架构内同步产出 720p 分辨率的画面,以及与之匹配的环境音、背景音乐和角色语音,声音会随着镜头的移动自然切换。
  3. 第一人称与第三人称双视角:第一人称下镜头与观察者的视野完全对齐;第三人称下模型会自动锁定人物、载具等主体并保持跟随,无需额外指定角色轨迹。
  4. 长时程、多轮次的连贯保持:把上一段结尾处的音视频当作下一段生成的上下文依据,经历多轮连续操作后,场景结构、角色外貌和声音质感依然维持高度一致。
  5. 可脚本化的动作编排:提供 Action DSL 动作描述方式,用”按键-帧数”的形式精确描述一段行进路线,方便复现和批量生成。
  6. 公开评测中的领先表现:在包含 158 个测试案例的 WBench 导航盲测中综合得分 81.7 分,在一致性与交互性两个维度上都处在前列。

EchoWM的技术架构:相机意图接口、数据引擎与四阶段训练

EchoWM 之所以能做到”边控边生成”且长时间不跑偏,靠的是三块互相咬合的工程与算法设计:

  1. 统一相机意图接口:把零散的键盘输入统一转换成相对初始姿态的连续 6-DoF 轨迹,用一套通用逻辑覆盖所有镜头调度。第一人称时它直接映射为观察者的位移;第三人称时模型会自主学习”主体移动”与”镜头跟随”之间的耦合关系,不再需要额外设置角色轨迹或预设相机参数。这条轨迹只作用于视频分支,音频分支与画面对齐。
  2. 世界数据引擎:训练数据融合了游戏实况、真人实玩影像、虚幻引擎(UE)模拟画面以及互联网视频四类互补来源。团队以轨迹的最大平移幅度作为统一的全局标尺做归一化,既保留了不同轨迹之间的相对位移差异,也避免了分段标定带来的速度突变问题。
  3. 四阶段渐进式训练:第一阶段用海量音视频数据做持续预训练打底;第二阶段冻结主干,只训练轻量级的轨迹分支以强化控制响应;第三阶段挑选兼顾控制力与视听品质的数据,以较低学习率做联合微调;第四阶段进入自回归后训练,先用 Teacher Forcing 转成因果分块生成,再用短时程 Self-Gradient Forcing 让模型适应自己生成的历史轨迹,最后通过分布匹配蒸馏把采样步数压缩到四步,并配合 sink-plus-FIFO 缓存策略控制 KV 内存开销,保证长时程流式交互的流畅度。

EchoWMHugging Face 上的 Echo-Team/Echo-WM 模型主页

如何使用EchoWM:从环境搭建到生成第一条漫游视频

EchoWM 目前以开源仓库的形式提供,需要本地具备 NVIDIA GPU 环境。按照下面的顺序操作,即可跑通官方示例:

  1. 克隆源码:用 git clone 把 github.com/jd-opensource/JoyAI-Echo 拉到本地,进入其中的 echo_wm/ 目录,该目录与长视频项目 echo_longvideo/ 彼此,不要混用。
  2. 准备虚拟环境:用 conda 创建名为 echo-wm、Python 版本为 3.11 的环境并激活,避免与系统其他依赖冲突。
  3. 安装运行依赖:先装 PyTorch 2.9.1(cu128 版本),再按 requirements.txt 补齐其余组件,装完后用一行代码确认 GPU 可被正常识别。
  4. 拉取模型权重:到 Hugging Face 的 Echo-Team/Echo-WM 页面下载所需 checkpoint。注意 Gemma 3 文本编码器属于受限仓库,需要先在网页端完成权限申请,再通过登录命令完成授权后才能下载。
  5. 验证安装:执行 python scripts/run_wm_case.py --case examples/wm_cases/0010 跑通内置案例,确认整条链路没有问题。
  6. 生成自定义内容:启动 inference_wm.py,准备好首帧图片、六字段提示词和动作串即可。动作指令采用 Action DSL,格式为”按键-帧数”,多段之间用逗号分隔,例如 w-60,a-60 表示先前进 60 帧再左移 60 帧,支持 w、s、a、d、i、j、k 等按键组合。

EchoWM的使用场景

由于兼具实时可控与视听同步两个特性,EchoWM 的落地方向比单纯的视频生成模型要宽不少:

  1. 游戏关卡与原型的实地验证:策划可以直接”走进”自己构思的场景试玩,在正式投产前就能检验空间尺度、动线规划和镜头感受,省掉大量前期建模成本。若你需要的是静态资产的三维重建,可以参考 CSM AI – 3D 世界模型AI 3D World 这类偏重建的方案,与 EchoWM 的动态漫游形成互补。
  2. 沉浸式互动叙事:剧情分支随观众的实时选择动态衍生,适合制作互动剧集、互动小说以及分支式短片。
  3. 影视与广告的体验升级:把原本”被动旁观”的素材改造成”主动置身其中”的体验,观众可以自主决定看哪里、看多久。只想要成片、不需要交互的团队,用 阶跃视频绘蛙AI生图/视频 会更直接,也可以先到 免费AI生成视频 做一轮横向试用。
  4. 低成本虚拟文旅与地产看房:博物馆、景区、样板间无需逐帧三维建模,就能实现线上云漫游,显著降低内容制作门槛。
  5. 数字人演艺与智能客服:让 AI 角色的语音、肢体动作与不断变化的环境、镜头、音效自然融合,用于虚拟主播、虚拟讲解员等需要”在场感”的场合。

EchoWM核心能力速览

项目说明
输出规格720p 分辨率,画面与环境音、语音同步生成
交互方式WASD 等键盘输入实时驱动,第一/第三人称双视角
动作编排Action DSL,”按键-帧数”格式,逗号分隔多段
评测表现WBench 导航盲测 158 例,综合得分 81.7,排名第一
训练流程持续预训练、轨迹分支训练、联合微调、自回归后训练四阶段
获取方式代码与权重均开源,需本地 GPU 环境自行部署

EchoWM的常见问题解答

EchoWM 和普通的 AI 视频生成模型有什么不同?
普通模型是一次性产出固定片段,观众只能被动观看;EchoWM 支持键盘实时驱动镜头,边操作边生成,并且画面与环境音、角色语音在同一架构内同步输出,具备持续交互能力。
运行 EchoWM 需要什么硬件条件?
官方示例基于 PyTorch 2.9.1(cu128)构建,需要可用的 NVIDIA GPU 环境。仓库未给出明确的显存下限,实际占用会随生成时长与分辨率变化,建议以仓库说明和实际测试为准。
长时间连续漫游会不会出现画面跑偏?
EchoWM 会把上一段结尾处的音视频作为后续生成的上下文,配合统一的 6-DoF 轨迹表示和四阶段训练中的自回归后训练,用于维持多作下的场景结构、角色外貌与声音质感一致。

EchoWM官网网址

代码仓库:https://github.com/jd-opensource/JoyAI-Echo

模型权重:https://huggingface.co/Echo-Team/Echo-WM

OpenI AI时代点评

在多数生成模型还在比拼”单片段画质”的时候,EchoWM 把竞争维度换成了”可交互、可续写、视听同步”。统一相机意图接口消解了第一人称与第三人称之间的工程割裂,世界数据引擎用统一的位移标尺把四类来源的数据揉在一起,四阶段训练则把控制响应、画质和长时程稳定性逐层补齐,最后用蒸馏与缓存策略把推理成本压到可以流式运行的水平。81.7 分的导航盲测成绩说明这套路线在一致性上确实站得住脚。

当然,它目前仍是一个面向开发者的开源工程:需要自己配 conda 环境、装指定版本的 PyTorch、申请受限仓库授权,门槛并不低。更现实的用法是先在具体场景里小范围试用——比如游戏原型验证、虚拟文旅导览或互动叙事,跑通之后再考虑规模化。若你的需求偏静态三维重建,可以配合 CSM AI – 3D 世界模型;若只是要快速产出成片,阶跃视频免费AI生成视频 这类工具会更省事。感兴趣的话,建议直接前往 EchoWM 代码仓库 查看最新的环境要求与示例说明。

阅读原文
© 版权声明

相关文章

AI聚合视觉工厂

暂无评论

暂无评论...