开源|京东开源JoyAI-Echo:全模态世界模型EchoWM实现720p同步音视频生成
thinkindev • 2026-08-26
2026 views
京东开源团队发布了 JoyAI-Echo 项目,推出全模态世界模型 EchoWM。该模型能够沿着连续的 6 自由度(6-DoF)相机轨迹运动,同时生成 720p 视频、环境声、音乐与语音,突破了传统世界模型以视觉为中心的局限。EchoWM 支持第一人称和第三人称交互视角,并采用渐进式加自回归的训练策略,实现了同步的长时域音视频生成。这一技术路线为空间智能、具身智能训练环境构建、游戏与影视内容自动化生产提供了新的基础能力。开源发布降低了长时域音视频联合建模的复现门槛,有望推动行业从单一模态生成走向全模态世界模拟。
核心要点
- EchoWM 全模态世界模型可同时生成720p视频、环境声、音乐与语音。
- 支持连续6-DoF相机轨迹以及第一/第三人称交互。
- 采用渐进式加自回归训练实现同步长时域音视频生成。