DC娱乐网

[LG]《DiG-bench: Discovery in Games》R M.

[LG]《DiG-bench: Discovery in Games》R M. Battleday, K Sandbrink, J Cullen-Drohan, Z Yan… [Thinking About Thinking] (2026)

在评估 AI 科学发现能力的领域,如何纯粹地测试它是一个悬而未决的难题。过去的方法受困于视觉感知或先验知识的干扰,本质原因是未能将“通过主动实验发现未知规律”这一核心环节独立出来进行测量。

本文的核心洞见是:把抽象的“发现能力”评估,重新看作一场规则与目标均未知的游戏。由此,让模型在纯文本环境中通过主动实验,自行推断隐藏的游戏物理和通关条件,这一关键操作使问题得以解开。

这项工作真正留下的遗产是一个用于衡量 AI 主动发现能力的纯净标尺。它为后来者打开的新门是:在无先验知识的环境中系统性地测试 AI 的探索与归纳能力。但尚未跨过的门槛是,模型如何从零散交互中稳定地构建出抽象的规则体系。

arxiv.org/abs/2608.12593 机器学习 人工智能 论文 AI创造营