
绝大多数机器人,还是在固定场景里“表演”,换个环境就“翻车”。
NVIDIA、Google DeepMind、宇树、银河通用……几乎所有头部玩家,都把答案指向了同一个方向——让机器人学会“先想象,再行动”。而在2026世界机器人大会上,这个方向又往前走了一大步,从“VLA与世界模型二选一”的争论,变成了三条路线并进、互相融合的清晰格局。
世界机器人大会现场人形机器人演示吸引大量观众世界模型,让机器人告别“看一步走一步”第一条,也是最核心的路线,就是世界模型。你可以把它理解成机器人的“物理直觉”——它不直接告诉你“下一步该怎么做”,而是先在脑子里推演“我这么做了,世界会变成什么样”。
图灵奖得主杨立昆把它定义为“能预测行动后果的内部模拟器”。这解决了VLA(视觉-语言-动作模型)最大的痛点:VLA擅长从人类数据里学“怎么做”,但不懂物理因果,换个场景、换个物体,成功率就暴跌。
宇树科技创始人王兴兴在大会上直言,机器人在固定场景训练后成功率可接近100%,但只要更换操作物品或微调环境,成功率就会大幅下滑,这是“全球大家共同的最大瓶颈”。
世界模型就是冲着这个短板来的。在大会上,北京人形机器人创新中心发布了全国首个统一表征具身世界模型Pelican-Unify,首次把视觉理解、动作操控和世界模型塞进了同一个模型,打通了“理解—推理—预演—执行”的闭环。
超维动力则展示了KAI世界模型,已经在百万级视频数据上完成预训练,现场演示了人形机器人自主乒乓球完整对局,靠的就是毫秒级窗口内的轨迹预测与动作规划。
人形乒乓球机器人展会上为观众演示对局操作这条路线上的玩家标签很清晰:
NVIDIA:靠算力和生态,Cosmos 3世界基础模型把物理AI训练周期从数月压缩到数天,FANUC、ABB、KUKA、安川四大机器人龙头集体接入;北京人形:走“大一统”路线,一个模型解决所有,已宣布商用;超维动力:走“全栈具身”路线,从世界模型到117个自由度的本体全自研,用打乒乓球来验证“大脑+小脑”的协同上限。WAM,把“想”和“做”统一在同一个模型里第二条路线,是世界-动作模型(WAM)。它做的事情更激进——从同一个表征中,联合预测下一帧视频和下一个电机指令。既知道“下一步该怎么动”,也理解“动了以后世界会发生什么”。
这条路线是由银河通用团队在2025年ICCV上首次提出的,目前已成为行业公认的下一代方向之一。银河通用发布的AstraBrain WAM 0.5,被其创始人王鹤称为“全球首次实现了虚实共融、人机混合、质量参差、有无动作标签的数据统一有效利用”。
今年,银河通用更是用这套模型实现了人形机器人自主打网球,被Elon Musk评价为“具身智能的AlphaGo时刻”。
另一位WAM路线的代表是DynaRobotics。这家由前DeepMind研究科学家创办的公司,发布了Dyna-2模型,从VLA转向WAM后,高精度制造任务成功率从20%跃升至80%-90%,仅需约13分钟的真机遥操作数据就能适配新任务。
Dyna-2模型驱动的机器人正在演示切菜操作这条路线上的玩家各有侧重:
银河通用:用打网球证明“大小脑协同”的全身智能,Scaling Law在具身智能领域开始显现;DynaRobotics:用WAM解决工业高精度制造,靠成功率从20%跃升至80%-90%说话;越疆科技:在大会上展示了“一脑多体”平台,用同一套空弈DobotWAM底座,让异构机器人(人形分拣→四足转运→工业装配)完成无缝接力。自进化,让机器人从“被动执行”到“主动学习”第三条路线,是正在浮现的机器人自进化体系。它的逻辑更长远:VLA和世界模型都是“先学会、再干活”,但物理世界的数据永远采不完,机器人必须拥有在真实工作中持续学习、主动探索的能力。
宇树科技王兴兴在大会上首次公开披露了“物理AI机器人自进化”体系:由AI大模型驱动,自己上网搜索论文和开源方案,自己写控制代码,在仿真里验证,部署到真机测试,再由AI和人类一起打分,形成闭环迭代。
深诣机器人联合创始人黄康尧则提出了“E4L”路线,主张让机器人在真实工作中持续更新参数,而不是做一个被动执行者。他直言:“VLA和世界模型不是终点,自进化才是关键。”
这条路线目前还处于预研阶段,但代表了行业对于“终极形态”的想象。宇树科技已经将AI模型作为公司资金和人力投入最大的方向,深诣机器人则用一套“混合物理专家模型”来承载自进化的理念。
终局判断:融合,而不是替代2026年世界机器人大会释放的信号非常明确:VLA、世界模型、WAM、自进化,这四条路线不是谁取代谁的关系,而是正在走向融合。
头部企业已经不再纠结“站队”问题。优必选展示了“基座模型-世界模型-行动模型”的全栈自研体系,Thinker基座大模型在10B以下的具身智能大脑评测中拿了9项第一,世界模型Thinker-WM在Libero评测中登顶榜首,VLA模型推理效率提升176%。
观众在优必选展位前举手机记录机器人演示星海图坚持“VLA+WAM”双线并行,用VLA保障实时操作,用WAM提供前瞻推演。小鹏汽车、智元机器人、无界动力、蚂蚁灵波……几乎所有玩家都在做“路线混搭”。
智平方CEO郭彦东的判断很精准:“世界模型不是VLA的竞争路线,而是VLA体系中的核心组成部分。世界模型负责理解世界,VLA负责作用于世界。”
王兴兴给出了一个“ChatGPT时刻”的量化标准:当一台机器人进入80%左右的陌生环境,通过自然语言指令即可完成约80%的日常任务,这个临界点快则2-3年,慢则5-10年。
在抵达这个临界点之前,世界模型还需要解决物理一致性难以维持的难题——目前业界最强模型只能维持几分钟的物理一致性,而工业可用门槛是连续可靠模拟一小时以上。
但方向已经清晰。从“看一步走一步”到“先想象、再行动”,从VLA一统天下到多路线融合,具身智能的“大脑”正在经历一场从统计相关到物理因果的认知跃迁。
谁先跑通这套“理解世界、预测后果、执行动作、自我进化”的闭环,谁就能在机器人真正走进工厂和家庭的那一天,站在牌桌的最前面。