DC娱乐网

[CL]《Toward Skill-Native LLMs: Skill Ent

[CL]《Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning》Y He, L Yang, J Liu, Y Yang… [Princeton University & CMU] (2026)

在长程推理领域,跨领域技能的动态切换是一个悬而未决的难题。过去的方法受困于单项技能评估的局限,本质原因是忽视了不同逻辑范式(如数学推导与日程规划)衔接时产生的“认知摩擦”与性能损耗。

本文的核心洞见是:把技能切换的难度重新看作可量化的技能熵。由此,在强化学习中要求模型同步预测答案与所属技能标签这一关键操作,使模型能够显式感知并平滑衔接异构的推理步骤。

这项工作真正留下的遗产是定义了技能原生模型的训练范式。它为后来者打开的新门是利用技能熵作为通用信号来增强复杂任务的鲁棒性,但尚未跨过的门槛是模型在极端高熵、完全陌生的技能组合下的逻辑自愈能力。

arxiv.org/abs/2608.05139 机器学习 人工智能 论文 AI创造营