DC娱乐网

[CL]《Cracks in the Foundation: Seemingly

[CL]《Cracks in the Foundation: Seemingly Minor Architectural Choices Impact Long Context Extension》A Bertsch, L Soldaini, M R. Gormley, G Neubig… [Ai2 & CMU] (2026)

在大型语言模型领域,长上下文扩展的架构选择是个高风险赌注。过去的方法受困于短上下文指标,本质原因是,某些看似无害的架构选择,其负面效应只在长文本中才暴露并叠加。

本文的核心洞见是:将QK Norm等“微小”架构选项,重新视为决定长上下文能力的“地基”。由此,通过大规模受控消融实验隔离变量,这一关键操作揭示了各选项的独立及复合影响,使优劣在早期即可判断。

这项工作真正留下的遗产是一份架构选择的实证“避坑指南”。它为后来者打开了在预训练之初就为长上下文而设计的新门,但尚未解决如何在不牺牲这些选项带来的训练效率与稳定性的前提下,达成此目标。

arxiv.org/abs/2608.10296 机器学习 人工智能 论文 AI创造营