[CL]《Hierarchical Latent Prediction for Language Models》C Shi, T Pearce, M Tomar, S Sen… [Microsoft Research & University of Texas at Austin] (2026)
在大型语言模型预训练领域,避免长程推理中的误差累积是一个悬而未决的难题。过去的方法受困于对“下一步”的短视预测,本质原因是模型缺乏一个俯瞰序列全局结构的宏观视角,导致误差滚雪球式放大。
本文的核心洞见是:把一连串连续的底层状态重新看作一个更高层的抽象表征。由此,额外训练一个“高层动态模型”来直接进行大步长的未来预测,这一关键操作使长程依赖的建模成为可能。
这项工作留下的遗产是:一种不牺牲推理速度,又能将层级规划思想嵌入预训练的有效范式。它为后来者打开的新门是设计更多面向长程目标的宏观辅助任务,但尚未跨过的门槛是让模型自适应地发现并学习这种层级结构。
arxiv.org/abs/2608.05806 机器学习 人工智能 论文 AI创造营



