DC娱乐网

World Model - day 45 问题:深度强化学习的样本效率差到臭名昭

World Model - day 45
问题:深度强化学习的样本效率差到臭名昭著,这直接卡死了它在真实问题上的落地。"在世界模型的想象里学"是目前最主流的解法之一,听上去很美——跟模拟环境的交互近乎无限。但前提很硬:这个模型必须在相当长的时间跨度上保持准确,否则智能体学到的只是模型自己的幻觉。而当时主流的 RNN 类隐动力学在长程一致性上并不牢靠。

解决方案:IRIS 的做法是把序列建模那一套原样搬进世界模型,让 Transformer 来干这件事:
世界模型拆成两截——一个离散自编码器把每帧图像压成一小串 token,一个自回归 Transformer 在 token 序列上预测下一帧、奖励和终止。等于把"想象未来"彻底改写成了语言建模问题
好处是 attention 天然带长程记忆,不像循环隐状态那样把历史挤进一个固定向量里,长时程 rollout 的一致性因此稳得多

智能体完全在这个想象出来的环境里训策略,真实交互只用来更新世界模型本身

Atari 100k 上只用相当于两小时的游戏时间,人类归一化均分 1.046,26 个游戏里 10 个超过人类,是当时不带前瞻搜索一类方法的新 SOTA(对比之下 MuZero 那类是靠 MCTS 换来的)
代码和模型都开源了,作者明说是为了推动后续对 Transformer 加世界模型这条路线的研究——从后面 DreamerV3、Genie 那批工作看,这个方向确实被接着做下去了
世界模型 多模态人工智能