[CL]《Off-Axis, On Purpose: Where a Transformer Computes Concepts and Why it Does So》M Oskin [University of Washington] (2026)
在 Transformer 解释领域,中间计算的“离轴”状态是一大难题。过去的方法受困于将其视为待修正的缺陷,试图强迫每层直接解码,本质原因是未能理解模型为何不在最终输出空间里直接进行思考。
本文的核心洞见是:把“离轴”空间重新看作一个受保护的计算工作区。由此,模型将跨词元概念混合的操作隔离在与输出正交的子空间内,避免了对最终词汇预测的干扰。答案在计算后期才通过加法被“写入”输出轴,而非旋转既有内容。
这项工作真正留下的遗产是揭示了 Transformer“离轴计算-在轴提交”的两阶段模式是一种设计而非缺陷。它为后来者打开的新门是:可以通过预设正交基底来主动塑造模型的内部计算几何。但尚未跨过的门槛是如何利用这种控制力,为特定任务设计出最优的计算框架。
arxiv.org/abs/2608.10251 机器学习 人工智能 论文 AI创造营








