36氪汽车:现在每个人都在讲世界模型,但似乎都不一样,比如说像汽车行业背景出身去做的这个世界模型,它真正的优势和它真正能做的东西是什么?
庄莉:我前两天看到Generalist AI那个公司(李飞飞以前一个徒弟的公司),他很反感别人叫他们物理世界模型公司,其实我也很同意这个事情。
飞飞的总结我觉得很对,飞飞是很善于把复杂事情总结成比较简单的逻辑。第一件事情,其实是所谓的渲染,跟做游戏那帮人对物理世界的渲染没有本质区别。游戏的渲染,本质上是一个Rule-based的渲染,它通过基于规则的物理引擎,规定了什么样的行为和现象可以发生。
现在只是把这个Rule-based的引擎变得模型化了,不用写得那么多复杂规则,比如一束光打过去,它就得反射过来。这些规则变成了模型化的东西,所以它看起来非常真实。
但是这个真实的背后是没有物理模型支撑的。就是你看到那个头发在那飘,有光泽,但它只是看起来像。非常obsessed(着迷) 的就是那个头发丝。还有衣服的那个皱,风吹过去的那个感觉。
面向渲染的物理AI本质上是解决从不同的角度去看物理世界的时候,是consistent(连贯) 的。但是视觉上的一致性未必有物理原理支持。
那飞飞说的第二个,是规划器。规划器这里边是需要有物理原理的。就说白了,力学你就得有牛顿的三个定律在里边,对吧?光学你就得有光学的各种原理,热学你就会有热学的各种定律。这个时候规划器是会真正地去规划你的这个动作怎么跟物理世界之间发生interaction(交互)的。
但是我们从第一性原理的角度去想,我会认为一个极好的规划器,最终100B的模型一定能搞定;如果aggressive(激进)一点,我觉得可能20B的模型就能搞定。它和Large Language Model(大语言模型)是两回事。
因为最后你要去理解的物理逻辑是什么?就是最多我们中学的物理书,再加上高等物理的、大学的物理书,所有的物理原理都在那了。所以最终你的模型要capture(获取)的不外乎就是这么多知识,它不像Large Language Model,它要capture的是人类历史上不断积累下来的所有的文字信息、所有的历史知识,所以它才需要那么大。
现在大家讲的物理AI模型非常多是是在规划器这个领域的,但是我不认为去构建所谓的generalized(通用化的)物理AI模型最终能成为技术门槛和商业护城河,因为它最终都是一个人会了、全世界都会的技能。而且在这里后训练的作用会非常大、甚至有可能超过了基座模型。那在后训练这个地方,就要来到第三个,就是所谓的Sim-to-Real(仿真到真实)。
就所谓的模拟器。因为在后训练的时候,你不同的场景是不一样的。比如,有没有能力大概照一张照片,就能构建一个虚拟的物理世界,就可以在这里边去产生很多simulation(仿真)数据。
那在汽车领域里边,我们做Reinforcement Learning,一定会有一个好的评估函数和一个好的simulator(仿真器)。没有好的simulator,就不能够产生摄像头数据跟规划之间的联系,我就不能模拟我对面有一辆车逆行过来,非要跟我撞的时候,我到底该干什么。
我觉得就在这第三个地方——模拟器,其实是最终能够把你的视觉和动作之间联系起来的一个最重要的东西,我自己也做过一些Sim-to-Real的事情,非常难。这个地方是有很多要去跨过的挑战,跨过去了,物理AI才有机会商业化。
现在我会觉得有很多在讲物理AI的,要不其实就是把原来做游戏的那套东西包了个皮,说到底就是把游戏引擎模型化;然后第二类,无外乎就是在中间做规划器,也就是我们自动驾驶领域在用的比如diffusion-based,flow-matching的规划办法。
杨立昆走的路线就是第二条路线,就是规划器的路线。第三个(真正的模拟器)可能现在大家还没有去touch(涉足),因为前两个都还没搞清楚,所以根本不知道要怎么样去建立联系的需求。
那现在的话,也有很多地方在拼命地采集数据,其实我们自动驾驶领域也采集过很多数据,有无数废数据,最后其实,就留在磁盘上都嫌占空间的这种。
所以我自己会觉得,就这个领域它非常地蛮荒。我坚定的相信,它最终一定会成为像自动驾驶这样子,变成被解决的问题。但是现在所有在贴标签、所有在讲故事的这样的一些新的创业项目,如果我是个投资人,我会觉得是有很大风险的。
从research(研究)领域,我还看不到技术到可以量产的路径。我个人觉得(具身创业)第一个阶段会在Mechanical Engineering(机械工程)方面取得突破,就是一些灵巧手的控制技术。它实际上不是AI,它更像我们汽车原来的线控底盘的这些技术。
就线控底盘得先成熟了,你才会有自动驾驶,否则你每次发出去的命令是一样的,它执行的结果不一样,这个要命了。第一个会先成熟的技术会来自于Mechanical这帮人,包括材料。紧接着才会有智能。
你没有办法把虚拟世界准确的映射到物理世界的时候,很难谈智能。
第二个,我自己的判断是模型不会很大。大家期望说找出一个特别大的通用模型去实现‘涌现’,技术可能不大会像Large Language Model这么发展。