[LG]《LeAct: Learning to Reason from Expert Actions》Z Yang, C Shi, R Ghugare, B Eysenbach… [Princeton University] (2026)
在复杂决策与博弈领域,获取高质量的思维链(CoT)数据是一个悬而未决的难题。过去的方法受困于对人类标注或强模型蒸馏的依赖,本质原因是大量现成的专家系统(如博弈求解器、规划器)虽能提供近乎完美的动作,却无法解释其背后的逻辑,处于“沉默”状态。
本文的核心洞见是:把专家系统的沉默动作重新看作对潜在思维链的约束信号。由此,LeAct 这一关键操作使问题得以解开:学生模型针对专家动作反向采样多种解释,并仅保留那些能显著提升自身还原该动作概率的解释,从而将外部专家的动作知识转化为可泛化的自然语言推理。
这项工作真正留下的遗产是证明了非语言类专家系统可以成为大模型推理能力的全新教师来源。它为后来者打开的新门是将各类垂直领域的专业求解器(如机器人控制、定理证明)转化为推理数据引擎,但尚未跨过的门槛是在动作空间极度稀疏或专家策略存在严重偏差时,如何维持反馈信号的有效性。
arxiv.org/abs/2607.21856 机器学习 人工智能 论文 AI创造营



