【生成式GTA的雏形:从“画个鹈鹕”到“写个中土世界”】Andrej Karpathy 最近用 Claude Opus 5 做了一个硬核实验:给它《指环王》第一段文字和 1M Token 预算(约 10 美元),让它用 Three.js 写代码直接渲染出书中的场景。模型埋头写了 2 小时、5500 行代码,虽然视觉效果带点“抽象派的简陋”,但它竟能靠空间推理自主编排多边形坐标并驱动动画,这让 Karpathy 预言未来会出现“即时生成的个人版 GTA”。这件事标志着大模型评测正从“画个骑车的鹈鹕”这种静态逻辑,转向长程、复杂的系统工程。底层逻辑的质变在于:当生成成本降到几乎为零,我们正从“没人会花周末去写这种定制代码”走向“只要想看,随手就能烧 10 美元造个世界”。不过,目前 LLM 的死穴在于“缺乏视觉反馈闭环”——它能写出代码,却没法像人类一样盯着屏幕边看边改,只能靠慢吞吞地截屏自检。这意味着,未来的杀手锏不是谁生成的代码多,而是谁能让 AI 拥有原生视觉感知,真正“看着”自己创造的世界进行实时修正。


