[CV]《Wonder: Video World Model Done Better》J Xu, H Jiang, Z Shu, K Sunkavalli… [Adobe Research] (2026)
在交互式视频世界模型领域,实现实时、长效且受相机精确控制的场景生成是一个悬而未决的难题。过去的方法受困于相机控制漂移、长程记忆丢失或推理延迟随时长线性增长,本质原因是控制信号过于抽象、内存管理效率低下以及蒸馏过程中的分布塌缩。
本文的核心洞见是:把相机控制重新看作一种显式的像素级视觉引导,并引入稀疏全精度内存机制。由此,通过渲染 3D 点阵与环境图提供空间对齐的运动线索,配合基于相似度检索的稀疏注意力操作,使模型在保持恒定推理延迟的同时,实现了对历史场景的精确回访与认知跳跃。
这项工作真正留下的遗产是构建了一个在高帧率下兼顾几何一致性与动态保真度的通用世界模型引擎。它为后来者打开的新门是实时、可交互的 4D 视频重拍与开放世界探索,但尚未跨过的门槛是在极度复杂的动态语义交互中保持物理规律的绝对严谨。
arxiv.org/abs/2607.26037 机器学习 人工智能 论文 AI创造营








