NVIDIA提出WorldTrace:让视频世界模型拥有可寻址记忆,突破长时序生成瓶颈
thinkindev • 2026-08-12
1278 views
NVIDIA研究团队近日推出了一项名为WorldTrace的训练无关框架,直指视频世界模型在长时序自回归生成中的关键短板——记忆遗忘与生成质量退化。该工作通过为压缩的键值记忆赋予稳定、分布内位置偏移的方式,确保记忆在远超训练时长的生成过程中仍可被准确寻址和访问。WorldTrace融合了两大核心设计:WT-Field负责在连续长镜头推演中维持场景与运动的时空一致性,有效抑制画面抖动和细节扭曲;WT-Landmark则通过构建可检索的地标记忆点,大幅提升模型对远距离场景的精准回忆能力,使得在需要跨越长时间间隔重现特定人物、物体或环境时性能显著优于现有方案。这一成果无需额外训练即可接入当前主流的视频生成模型,为扩展到更复杂的虚拟环境模拟、具身智能感知以及高保真数字孪生等应用提供了重要的技术支撑,也标志着视频世界模型从“几秒幻觉”迈向“分钟级连贯叙事”的关键一步。
核心要点
- WorldTrace是NVIDIA推出的训练无关框架,赋予视频世界模型在长序列生成中可寻址的记忆能力。
- 提出WT-Field保持连贯的长镜头生成,以及WT-Landmark实现远距离场景的精确回忆。
- 无需重新训练即可接入现有模型,极大拓展了视频生成在虚拟环境和具身智能中的应用边界。