之前 张小珺 采访 英伟达刘洺堉 的博客非常好,甚至是我个人认为小珺采访最好的一次,分享一些小信息:
张小珺:你们定了要做世界模型,这个世界模型是为 Physical AI 服务的。大家对于世界模型的定义还是非常不清晰,你给我们讲讲你的世界模型的定义吧。
刘洺堉:我是个有实用性的人嘛,人为什么会去设计一个模型呢?是因为它可以用,用法有很多种。
你设计一个模型来描述这个世界,仅有这个模型,你可以去预测接下来发生的事情,所以它的目的是为了预测。
这是一种世界模型的设计原因:用处是预测。
另外一种是,你想去理解为什么这件事情发生了。
某方面来讲,整个物理学就是在建世界模型,去了解这个世界是怎么运作的。从牛顿力学一路到量子力学,就是去了解这个世界的运作,也是建一个模型嘛,然后帮助我们理解它怎么运作。
当然,在 deep learning 里面,我们把这个 understanding 变成:仅有一些标注的数据去教这个模型——「这个东西会这样,是因为发生了这件事情」——然后经由大量的数据泛化,帮助未来新的事件发生的时候,你先有看到的视觉讯号,然后去解释、帮助人理解发生了什么事情。
比如说在工厂里面,为什么这个地方产线卡住了?是因为之前某个工人忘记把什么东西打开。这也是世界模型的一个目的性,为了去理解发生了什么事情。
还有另外一种世界模型,是为了要去重建这三维世界。
重建三维世界有很大的用处:去规划你的路线要怎么走;你可以让人去体验,人虽然不在这个真实世界,但你可以在虚拟的状态下在这个世界里面做游历。
因为你的用处不同,模型的形态长得不一样。
终究我们是在同一个世界里面,模型就是不同的,经由不同的观察来描述同一件事情。重建是一个很重要的学问,我自己以前就是做重建的,但我现在已经不再做重建了。
我现在主要做的是物理世界的理解和物理世界的预测(prediction)。
这些事情,就是大家都会对世界模型有不同解释的原因。