DC娱乐网

GLM-5.3 AA 追平 Kimi K3,期待开源下一张牌

刚看完 Artificial Analysis 对 GLM-5.3 的评测。

最显眼的数据是:GLM-5.3 在 Intelligence Index 拿到 60 分,追平 Kimi K3,相比 GLM-5.2 的 53 分直接涨了 7 分。

值得看的不仅是总榜,还有 Agent 能力。
在 GDPval-AA v2 上,GLM-5.3 的 Elo 从 1524 涨到 1770,一次提升 246 分,目前仅次于 Claude Opus 5。

这说明它这次不是单纯“更会考试”了,而是更会把事情做完了。

更有意思的是,它还是 753B 总参数、40B 激活参数,并没有简单靠把模型做大来换成绩。

这也说明,今天模型能力的上限越来越取决于 Post-training、RL、Tool Use、Agent Training 和 Reasoning,而不只是 Pre-training。

当然,能力提升也有代价。

GLM-5.3 平均每个任务输出约 1.87 万 Token,比 GLM-5.2 多 20%,也高于 Kimi K3。

换句话说:更聪明了,也更能烧 Token 了。

作为开源模型,GLM-5.3、Kimi K3 已经做到 60 分,距离最顶级闭源模型只差几分。
当能力只有闭源的 70% 时,开不开放没那么重要。
但如果做到 95% 甚至 98%,企业就会开始重新算账:为什么一定要为了最后几分,多付一倍的钱?

尤其另一个模型还能私有部署、深度定制、优化推理框架、针对自己的 Agent 场景继续训练。

最后还有一点挺有意思。

GLM-5.3 现在才追平 Kimi K3。
那自然会让人开始期待:K3 的下一个模型呢?

GLM-5.3 已经证明,同一个模型底座,通过更强的 Post-training 和 Agent Training,还能继续挖出大量能力。

那么拥有 K3 这张 2.8T 大底牌的 Kimi,下一轮还能榨出多少东西?

#GLM53 #KimiK3 #KimiK4 #大模型 #AI智能体 #开源模型 #OpenWeight #大模型评测