[CL]《One Frozen Simulator Is Not Enough: Simulator Collapse in Multi-Agent RL》S Yu, N Tomlin, M Abdulhai, X Lu… [Northeastern University & New York University & UC Berkeley] (2026)
在人机交互AI领域,从模拟训练到真实应用的泛化是一大难题。过去的方法依赖单一、固定的AI模拟器,本质原因是其行为模式高度固化,导致受训AI只会利用其特定弱点,而非学习通用能力。
本文的核心洞见是:把训练伙伴从“固定靶”重新看作“动态对手集”。由此,“策略与模拟器种群共同训练”这一关键操作解开了死结:它迫使AI放弃狭隘的利用策略,转而学习鲁棒的交互能力。
这项工作真正留下的遗产是:首次定义并量化了“模拟器坍塌”这一关键失败模式。它为后来者打开的新门是,将研究重心从优化策略本身转向构建多样化的训练环境。但尚未跨过的门槛是,如何低成本地维持该环境的演化与多样性。
arxiv.org/abs/2608.12253 机器学习 人工智能 论文 AI创造营








