DC娱乐网

[AI]《One Run Is Not an Idea: The Impleme

[AI]《One Run Is Not an Idea: The Implementation Lottery in Automated Research》J Ning, S Zhong, X Li, J Zeng, C Xiong [CMU] (2026)

在自动化科学研究领域,如何从实验结果中准确归纳出“科学想法”的有效性是一个悬而未决的难题。过去的方法受困于将单次代码实现的得分直接等同于想法本身的质量,本质原因是忽略了从抽象概念到具体代码翻译过程中随机采样带来的“实现博弈”噪声。

本文的核心洞见是:把自动化研究中的单次实验重新看作是对想法空间的一次随机采样,而非确定性度量。由此,引入“想法可靠性审计”这一关键操作,通过冻结核心机制、在独立会话中多次重复实现并分离代码运行噪声,使想法本身的信号得以从实现细节的干扰中解开。

这项工作真正留下的遗产是提出了区分“最优产物效用”与“想法可靠性”的评估范式。它为后来者打开的新门是建立了一套量化科研诚信的审计协议,以防止 lucky run 误导研究方向,但尚未跨过的门槛是在更复杂的深度学习长程工作流中,如何高效处理指数级增长的实现路径分支。

arxiv.org/abs/2607.26587 机器学习 人工智能 论文 AI创造营