Claude Opus 5震撼发布 先说结论:Opus 5 很强,但远没有强到重新定义这一代模型,更没有强到让 Anthropic 继续享受“闭着眼选 Claude”的品牌溢价。
纸面上,它给了 100 万 token 上下文,API 价格是输入 5 美元、输出 25 美元/百万 token。Anthropic 自己的 System Card 里,Opus 5 在 SWE-bench Pro 拿到 79.2%,高于 GPT-5.6 Sol 的 64.6%;OSWorld 2.0 是 70.6% 对 62.6%,ARC-AGI-3 更是 30.2% 对 7.78%。这些进步必须承认,尤其在复杂软件修复、电脑操作和抽象推理上,它确实赢了。
但赢下几个项目和形成代际碾压是两回事。BrowseComp 是 90.8% 对 90.4%,几乎打平;双方官方公开的 DeepSWE 成绩里,则是 Sol 72.7%、Opus 5 为 68.8%。不同厂商的测试框架当然不能完全画等号,但至少说明 Opus 5 仍是一台偏科明显、发挥依赖具体任务和 Agent 框架的强模型,而不是在编程、搜索、知识工作和推理上全面拉开一代差距的统治者。
这也是我讨厌 Anthropic 的原因:它总想把一个技术产品包装成价值观、路线正确性和行业裁判权的合集。但中美 AI 竞争已经进入算力、出口管制、闭源平台和开发者生态全面博弈的阶段,中国开发者不该为一家美国闭源公司的姿态付费,只该为不可替代的能力付费。没有碾压,就没有形成战略依赖的理由。
更现实的是,Kimi K3 同样提供约 100 万 token 上下文,API 输入、输出价格分别是 3 美元和 15 美元。在采用统一 mini-SWE-agent 的 DeepSWE 榜单上,K3 为 69%±5%,Opus 5 为 74%±4%;K3 做到约 93% 的分数,平均单任务成本却只有 4.65 美元,对面是 11.84 美元。
所以 Opus 5 不是垃圾,但如果它对 GPT-5.6 Sol 没有稳定、全面、可复现的碾压优势,那它就是 Anthropic 又一代“局部领先、整体平庸”的昂贵产品。对绝大多数开发者的编程与 Agent 任务,Kimi K3 已经足以替代它。而他们更应该担心的是,中国的开源模型在让世界变得更好,而美国的闭源模型在向世界渲染恐慌。
真正该被奖励的,不是美国模型的光环,而是更低成本、更本土化、也更接近同一能力水平的中国模型。