DC娱乐网

确实,机器人大脑不能再抄大模型作业了。

下午听了外滩大会具身智能分论坛的圆桌。沈宇军说,他现在觉得讨论 VLA 和 World Model 到底哪条才是正确路线,没什么意义。

这两条路线都只是过渡方案。机器人最后一定会像自动驾驶一样,慢慢长出一套属于自己的模型和训练体系。

大家可以想象机器人需要哪些能力,抽象来看,就三个:

1、怎么把传感器不断输入的原始信号,变成模型真正能理解的 token。

2、怎么把视觉、空间、力、触觉这些不同信息真正融合起来。

3、在理解这些信息之后,怎么生成可靠的动作策略。

这些能力都是今天的大语言模型从来没有学过的。所以具身公司迟早还是要啃这些硬骨头。

VLA 和 World Model 这两年之所以这么火,是因为大家看到数字世界已经有非常成熟的大模型,于是就琢磨可以嫁接到具身领域。

诸如 VLA,本质上就是把已经很成熟的视觉语言模型拿过来,再加上 Action,让模型从看懂世界,进一步学会控制机器人。

无论是 VLA 还是 World Model,本质上都是站在数字世界已有的工具上思考机器人的问题。但真正开始进入真实场景之后,他们发现很多问题没办法一直靠嫁接解决。

毕竟数字世界的模型有自己的优化目标,机器人也有自己的需求。差异越往后越大,继续修改现成模型的成本也会越来越高。

所以蚂蚁灵波做了一个更激进的决定。涉及视觉、空间、动态建模这些和物理世界强相关的部分,开始按照机器人的需求重新设计,甚至从头训练。

他们的判断是,机器人需要具身原生的模型。

所谓具身原生,我理解沈宇军真正想说的是,机器人不能一直沿用数字世界已经定义好的模型结构和训练目标。因为模型最终会被自己的目标函数塑造成不同的东西。

视频模型追求的是生成一段看起来足够真实的视频,大语言模型追求的是预测下一个 Token。但机器人真正关心的是真实世界中的感知和行动。

这些目标完全不一样。接下来一两年内,具身模型大概率会像自动驾驶那样,有一套单独的模型和训练体系。

我听完,就一个感觉,具身模型技术路线远没有到收敛阶段,很多公司都还在拿着大模型时代的工具,摸索物理世界新规律的阶段。

但从数字世界嫁接模型的思路,终归只是过渡。