EMNLP’26 🐧混元&北大
分享一下近期在混元完成的工作 (1/2),本文中稿Findings
🪐ORBIT:分档推理模型
传统Efficient reasoning方法要求模型直接估计解决问题所需预算,然而我们认为该估计worst case等价于停机问题,且训练时固定性能-预算tradeoff限制了灵活部署。
本文将预算选择移动到推理阶段,并提出ORBIT:一个on-policy的多档位推理模型训练框架。一阶段采用单轮的扩展-压缩multistage-RL,获取不同档位的前沿policy,二阶段通过merge不同前沿policy初始化,并通过MOPD将各个档位的能力整合进统一模型。
实验结论
- 扩展压缩循环仅基于context调度的截断即可有效完成reasoning压缩,多阶段产出policy有效建立前沿,一致超过基于RL的efficient reasoning baseline
- ORBIT能够无损融合若干档位policy,并泛化到OOD场景保序
据我们所知,本文是第一篇提出reasoning effort维度MOPD合版的工作,该方式后续也被前沿生产实践证实(DeepSeek-V4,Kimi K3等)
arXiv:2601.08310
EMNLP EMNLP26 LLM RL


