DC娱乐网

【一文读懂】都叫世界模型,水平为什么差这么多?接上期“端到端、VLA、强化学习、

【一文读懂】都叫世界模型,水平为什么差这么多?

接上期“端到端、VLA、强化学习、世界模型怎么理解?”网页链接,咱们继续。

上一篇讲过,行业在端到端1.0阶段达成短暂共识之后,到了1.5阶段,又分化成两大分支:VLA vs 世界模型+强化学习【图1、图2】。

前者让AI翻阅“人类语言宝库”,从知识中学习;后者构造虚拟场景,让AI自己练。

随着VLA路线的瓶颈逐渐显现,行业又开始加大“世界模型+强化学习”的比重。蔚来NWM、Momenta R6、华为乾崑WEWA 2.0、地平线HSD V2.0,都明确强调了强化学习。

而强化学习往往和世界模型一起出现。两者是天然绑定、生死不离的吗?

并非如此!

你我从降生到这个世界的那一刻起,就开始了强化学习的漫长旅程。跌倒教会我们走路,灼痛教会我们远离火焰,失败教会我们辨认歧途;爱、失去与告别,则一点点教会我们如何成为今天的自己。

世界用奖励鼓励我们,用惩罚修正我们。这就是人生的强化学习,哪里需要什么世界模型?真实世界本身就是我们的训练场。

理论上,智能驾驶也不需要世界模型。直接OTA给用户,让大家上路跑呗!但这会遇到两个近乎无解的问题:

- 后果严重:人学走路时摔一跤,通常只是疼一下;智能驾驶试错一旦失败,却可能车毁人亡。就像咱们掉进悬崖,其实也学不到什么东西。你不能为了教会它处理鬼探头,就真的安排一个人冲到车前;也不能为了让它学习极限避让,先在现实中撞上几百次。

- 概率太低:Corner Case种类极多,但每一种出现的概率又极低。完全依靠真实道路收集,想把这些长尾场景挨个遇上一遍,不知道要等到猴年马月。

所以需要一个虚拟世界。

强化学习负责“练”,世界模型负责提供“练习场”。撞了可以重来,现实中十年难遇一次的危险场景,在里面一天可以跑上万遍。这就是所谓的“一秒万年”。

问题也随之而来:既然训练效果取决于练习场,那么不同世界模型搭出来的练习场,水平能一样吗?

青蛙小时候叫蝌蚪,虚拟环境刚起步时也只能叫“仿真”,不能一上来就封为世界模型。我研究了一圈,从科普角度把用于强化学习的虚拟环境,大致分成四代【图3】:

第一代,回放型仿真,就像录像带回放。

它对应真实数据回放:真实道路上发生过什么,系统就把它重新放一遍。这是最真实的数据,问题在于不可交互。别的车、行人、电动车,都会按照原来的轨迹走。仿真里就算你撞上了,也只会“穿模”,并不会发生真正的碰撞。

这个阶段的仿真,连红白机游戏都不如。

第二代,规则型 NPC,达到红白机游戏的水平了。

别的车终于像个活物了:你靠近,它减速;你插队,它让一下;你变道,它刹一下。但这些反应主要靠规则写出来,有点像红白机游戏里的敌人,会动,但套路固定。只要你记住规律,就可以无伤通关《魂斗罗》,称霸小县城。

很显然,这种仿真级别的训练效果有限。

第三代,学习型交通参与者,达到了3A 单机大作的水平。

别的车不再只是按规则反应,而是从真实人类驾驶数据里学出来。它会有激进、保守、犹豫、抢行等不同风格,也会根据你的动作做出更像真人的反应。就像经典3A大作大家百玩不厌一样,到了这一层,仿真才开始真正有世界模型的味道。

第四代,就是 Multi-Agent / self-play,就像多人在线大型网游。

这里不只是别人像真人,而是多个 agent 都有自己的目标和策略,甚至可以一起训练、互相逼出更复杂的局面。

你今天用一种开法,它明天可能就学会了新的应对方式。是不是开始像真实世界了?这也正是多人在线网游的魅力所在:画面、剧情可能不如单机 3A 大作,但真实互动的魅力无可替代。

以上就是虚拟训练环境的四个层次。

至于蔚来NWM、Momenta R6、华为乾崑WEWA 2.0和地平线HSD V2.0分别处于哪一层,大家可以自己分析,也欢迎在评论区告诉我答案。

从目前公开的信息来看,华为乾崑WEWA 2.0已经进入第四代,因为它明确强调了Multi-Agent群体博弈。而且,这和ADS 4、ADS 5目前的实车表现也能对得上。

世界模型先讲到这里。下一期继续讨论一个问题:

VLA可以借助语言和人类知识理解风险;但世界模型路线如果不依赖显式语言推理,它怎么知道一个行人是否准备横穿、一辆电动车会不会突然窜出来?

难道真要把路上每个对象未来几秒的所有动作都算一遍?那运算量岂不是要爆炸?世界模型WEWAVLA