[LG]《The Sparsity Whisperer》L Kong, I Subramanian, M Adler, D Alistarh… [MIT] (2026)
在大型语言模型剪枝领域,如何精确识别并保留真正关键的权重是一个悬而未决的难题。过去的方法受困于用激活值大小或层输出重建误差来评估权重,本质原因是这忽略了某些神经元的真正功能:将相似的输入映射为有区别的输出。
本文的核心洞见是:把权重的重要性从“产生大激活值”重新看作“有效地区分输入”。由此,设计一种直接度量并保留那些能将微小输入差异放大为显著输出差异的权重的新标准,这一关键操作使问题得以解开。
这项工作真正留下的遗产是为模型剪枝引入了一个全新的、可组合的评估维度:输出差异保持度。它为后来者打开的新门是将此信号与现有方法融合以提升剪枝上限,但尚未跨过的门槛是如何在预训练阶段就内化这种区分能力,而非仅做事后补救。
arxiv.org/abs/2608.06630 机器学习 人工智能 论文 AI创造营






