DC娱乐网

多模态|视频模型真的学到了“物理规律”吗? 如果一个 AI 看几段视频,就能判断

多模态|视频模型真的学到了“物理规律”吗?
如果一个 AI 看几段视频,就能判断物体会往哪里运动、什么场景违反常识,它是真的“理解了物理”,还是只是把视频里的模式记得足够熟?

最近一篇很有意思的论文《Interpreting Physics in Video World Models》,没有继续只看模型答对了多少题,而是直接往视频模型内部看:速度、加速度、运动方向这些物理信息,到底在哪里出现,又是怎么被表示的。

结果很反直觉。研究发现,物理信息并不是从第一层开始就完整存在,而是在网络中间出现一个明显的变化区间,作者把它叫作 Physics Emergence Zone。速度、加速度这样的标量信息比较早就能被读出来,但“物体往哪个方向运动”这种信息,要到更深的位置才变得明显。

更有意思的是,模型内部似乎也没有偷偷长出一套“小型牛顿力学引擎”。比如运动方向并不是被压成一个简单变量保存,而是分布在很多维度共同形成的表示里。也就是说,它可以做出符合物理的预测,却未必是按照人类写物理公式的方式在计算。

这对工程上很重要:以后评价 World Model,可能不能只看“视频预测得像不像”,还要问它内部到底形成了什么样的世界表示。尤其当这类模型进入机器人和 Physical AI,能不能检查、理解甚至干预这些内部表示,会越来越重要。

再往前一步想,人类小时候也不是先学会公式,再知道球会往下掉。我们同样是从大量观察中逐渐形成对世界的直觉。但“都从经验中学习”并不等于人脑和视频模型使用了相同的机制。

所以真正的问题可能不是“AI会不会物理”,而是:能够正确预测世界,距离真正理解世界,还有多远?

AI 人工智能 多模态 WorldModel 计算机视觉 VJEPA