DC娱乐网

【Kimi Linear:大模型架构的“苦涩教训”与效率革命】月之暗面(Moon

【Kimi Linear:大模型架构的“苦涩教训”与效率革命】月之暗面(Moonshot AI)发布的 Kimi Linear 架构通过 Kimi Delta Attention(KDA)实现了对全注意力机制的超越。在 3B 激活参数规模下,它比标准 MLA 架构减少了 75% 的 KV cache 占用,并在百万级长文本推理中提升了 6 倍吞吐量。这不仅是技术参数的提升,更是对 Transformer 效率瓶颈的一次成功突围。这件事揭示了 AI 领域的底层逻辑:当硬件算力成为天花板,谁能把算法写得更符合硬件特性,谁就能在 Scaling Law 的竞赛中跑得更远。国内用户常看到的“蒸馏”争议,往往掩盖了这种架构层面的硬核创新。与其纠结数据来源的口水战,不如关注这种将线性注意力与 RNN 逻辑融合的路径,它证明了“大力出奇迹”也需要更高效的杠杆。Kimi 选择开源内核与权重,实际上是在用工程透明度回应外界对“套壳”的质疑,同时也为长文本处理提供了一套更具性价比的工业标准。 arxiv.org/abs/2510.26692