[AI]《Can AI agents conduct open-ended AI research? Early evidence from two case studies》P Kirgis, S Kapoor, A Schwartz, S Rabanser… [Princeton University] (2026)
在人工智能自动化研发领域,评估智能体能否独立完成开放式科研是一个悬而未决的难题。过去的方法受困于任务过于狭窄(仅限可验证指标)或同行评审随机性强,本质原因是缺乏既能模拟真实科研深度、又能防止模型训练数据污染的严谨评估框架。
本文的核心洞见是:把科研评估重新看作对未发表高水平论文的“影子追踪”。由此,让智能体在无参考情况下挑战真实论文的核心命题,并由原作者进行深度评审这一关键操作使问题得以解开,从而精准定位了智能体在工程执行与科学判断之间的能力断层。
这项工作真正留下的遗产是揭示了当前智能体“能做工程却不会科研”的局限,并界定了判断力缺失和指令漂移等五大失效模式。它为后来者打开的新门是建立专家级开放式评估标准,但尚未跨过的门槛是赋予智能体质疑假设、从死胡同有效回溯的创造性认知能力。
arxiv.org/abs/2607.27191 机器学习 人工智能 论文 AI创造营





