ai产业链
World Labs Atlas:三维空间,开始成为 AI 的控制界面
信源:MTS|Justin Johnson(World Labs 联合创始人)访谈|视频发布于 2026-09-06。
导演想精确改变镜头轨迹,建筑师想从另一侧检查空间,机器人工程师想测试同一场地里的不同动作。这些需求,都要求 AI 的输出能够接受明确的控制。Justin Johnson 在访谈中反复强调的 Atlas 路线,正是让三维空间成为这种控制界面。**它的产业意义,在于把生成结果变成可以修改、复用,并接入专业工作流程的对象。**Johnson 开场也说明,此次是模型发布,后续产品尚待推出。
理解这条路径,要先看 Atlas 如何组织输入。照片里的房间、桌子和门,都对应某个观察位置。Atlas 把图像与相机的位置、朝向关联起来,形成“空间上下文”,再按照指定视点生成画面。用户可以摆放参考图、规划相机路径,让不同输出受同一组空间条件约束。官方将其架构描述为多模态自回归扩散 Transformer:沿序列逐个生成输出,并通过扩散过程生成图像等连续数据。
这改变了人对生成过程的控制方式。影视创作者说“镜头向左移动”,仍可能得到方向大致正确、构图却不合意的结果;给出相机轨迹,则能明确表达从哪里看、怎样移动。专业工作中的成本往往积累在反复修改:客户要求换一个角度时,已经确定的场景能否保留?空间约束的经济意义,是让一次生成的成果能够承接下一次修改。画面质量相近时,这种可复用性会影响工具能否进入生产流程。
Atlas 对输出方式的调整,也服务于这种实用性。Johnson 解释,Marble 此前的图像和视频输出,需要先经过三维高斯表示再渲染;Atlas 提前分开二维与三维路径,能够直接生成画面,也能在需要时提供三维结果。高斯表示可以理解为用大量带颜色、透明度等属性的空间元素来描绘场景。
两条路径对应不同的计算成本。电影镜头可以接受离线生成;手机、VR 和游戏需要持续响应用户动作,生成资产后在本地渲染,仍有实际价值。Johnson 也承认,让服务器实时生成并持续传回所有画面,目前仍有成本和技术门槛。因此,世界模型的采用很可能先表现为进入现有引擎和制作流程,逐步承担更多环节。
机器人把这个问题推进了一层。一个通用策略即使学会了抓取,到具体工厂仍会遇到不同的桌面高度、物体摆放、相机视角和接触条件。Johnson 设想,拍几张照片重建现场,再让机器人在仿真中微调或接受测试,能够缩短部署的“最后一公里”。但“几分钟完成适配”仍是愿景,这里的关键是复制决定任务成败的条件。
也正是在这里,空间生成遇到了更严格的要求。绕着杯子生成一致的视图,与预测杯子受力后怎样滑动,是两种能力。同样外观的箱子可能空心,也可能装满;照片无法唯一确定质量、摩擦等参数。Atlas 官方也明确表示,未被观察到的区域会由模型合理补全。对创作而言,补全提供便利;对机器人而言,补出的结构必须接受任务验证。
World Labs 已经在推进这一步。公司 7 月公布的 SceniX 团队 R2S2R 系统,展示了涉及刚体、关节和可变形物体的仿真及实机迁移。更值得关注的是评估实验:在双臂方块交接任务中,每个策略检查点进行 2,000 次仿真试验与 100 次实机试验,公司报告两者能保持策略表现的相对排序。这是整套系统的自报结果,不能全部归因于 Atlas 单模型,却提供了一个比画面逼真程度更有用的衡量标准:仿真能否帮助工程师选对策略、提前找出失败条件。
沿着这条机制推演,未来有价值的资产可能是经过实机校准、能够反复使用的任务环境。客户更换策略模型,调整设备,或者修改作业流程,都可以重新运行测试。世界模型由此可能进入机器人部署与持续验证的支出,而收入能否成立,取决于它节省了多少现场采集、调试和复测成本。
这条路线也有直接竞争者。Johnson 同时提到,机器人可能通过上下文中的一次示范,就学会适应新任务。如果这种泛化能力足够强,逐场地微调的必要性会下降,仿真的价值会更多集中到评估和复杂失败场景。判断这一方向后续进展,应看真实部署中需要补采多少数据、节省多少工程时间,以及仿真发现的问题是否会在实机出现。
至于标题里的“超越 LLM”,访谈给出的具体协作方式更有解释力:coding agent 通过 API 组合世界模型与其他工具。语言模型负责组织任务,空间模型提供可控制的环境,工程验证决定结果能否投入使用。Atlas 能走多远,取决于这条协作链能否把控制能力转化为可重复的生产收益。