DC娱乐网

[CL]《Information Abundance Paradox: Long

[CL]《Information Abundance Paradox: Long-Context Training Undermines Parametric Knowledge》A Uzunoglu, B v Durme, D Khashabi [Johns Hopkins University] (2026)

在长上下文模型训练领域,性能随窗口扩大反而下降是一个难题。过去的方法受困于“上下文越长越好”的直觉,本质原因是训练时丰富的信息捷径,让模型放弃了将知识固化于参数。

本文的核心洞见是:把模型学习看作“参数记忆”与“上下文查找”的策略竞争。由此,揭示训练时过量信息会让模型变“懒”,倾向于即时查找而非长期记忆,这一机制解开了性能悖论。

这项工作真正留下的遗产是“信息丰裕悖论”这一概念。它为后来者打开的新门是如何设计平衡“查找”与“记忆”的训练策略,但尚未跨过的门槛是如何在不牺牲上下文优势的同时强制模型记忆。

arxiv.org/abs/2608.12218 机器学习 人工智能 论文 AI创造营