【Kimi-K3 无疑是对 OpenAI 和 Anthropic 的一次挑战——性能几乎一样出色,成本只需要1/1到一半】
(汤姆硬件)好吧,这款人工智能猫的秘密已经公开了。在发布了关于全新推出的Kimi K3的博客文章和API文档后,中国公司Moonshot AI兑现了其承诺,免费公开了该模型的权重。这意味着,只要拥有现代化的AI GPU机架,几乎任何人都可以运行该模型并以此收费,且几乎没有限制。
这无疑是对大型AI企业——尤其是Anthropic和OpenAI(但不限于这两家)——发出的强烈警告。这些公司的最新模型分别是Claude Fable和GPT-5.6 Sol,而恰巧在Moonshot的基准测试中,Kimi K3的性能不仅完全超越了前几代的Claude和GPT,而且与Fable和Sol的差距也微乎其微——与此同时,其运行成本仅为前者的1/3到一半,如果特定查询恰好命中缓存,成本甚至可降至前者的1/10。Moonshot的技术报告似乎印证了上周发布的基准测试结果,该公司在报告中披露了测试所使用的具体软件。
关于推理成本的比较,Moonshot表示其成本是“内部测算”得出的,而非基于其他公司公开的代币定价,但这些数据相当令人印象深刻。就输入而言,Moonshot对Kimi K3的收费标准为每100万个代币3美元。与此同时,Fable的费用为每100万代币10美元,而Sol则为每100万代币5美元。该数据基于标准的非缓存输入,表现已相当出色,但Kimi K3的缓存结构在编码任务中似乎拥有90%的命中率,因此如果您的用例频繁命中缓存,每100万代币的费用将从3美元降至0.30美元。输出代币的情况也大致如此。
Kimi K3 之所以如此高效,一个可能的原因在于它混合使用了 MXFP4 处理权重和 MXFP8 处理输入激活,这两种数据类型精度相对较低,因此可以在远少于 VRAM 的条件下运行。此外,在 Kimi 的 2.8 万亿个参数中,每次仅激活 1042 亿个。
有趣的是,Moonshot 的报告仅提到在某些编码测试中使用了英伟达的 H20 来运行 Kimi,按当今标准来看,这是一款相当低端的芯片。与受出口管制的 Blackwell B 系列芯片不同,该 GPU 不原生支持 MX 浮点类型。
反过来说,这可能意味着 Kimi K3 的优化使其特别适合在低端硬件上运行,但同样合理的推测是,如果在 Nvidia Blackwell 或其他原生支持 MXFP 的芯片上运行,其性价比可能会比所展示的基准测试结果更高。我们需要等待更多官方数据来证实这一推测。
此外,Kimi K3 并未采用传统的那种不断扩容的键值(KV)存储结构,而是依赖于一个名为“Kimi Delta Attention”的固定大小状态处理器,这在理论上同样可以节省显存和执行时间。其专家混合(MoE)模型具有极高的稀疏性——896 个专家中每次仅激活 16 个,这进一步降低了推理成本。总体而言,Moonshot 致力于在推理的每一层进行优化,以避免不必要的开销并降低推理成本。
这对 OpenAI 和 Anthropic 来说可能是个坏消息,因为现在几乎任何拥有性能不错的 AI GPU 的人都能成为它们的直接竞争对手;而且 Kimi K3 采用开放权重模式,这也让人觉得“免费”软件的性能几乎与专有竞争对手相当,而运行成本却低得多。值得注意的是,“开放权重”并不等同于“开源”;训练过程和数据集仍然是 Moonshot 的独家秘方。
