刚刚,智谱正式发布 GLM-5.3。与 GLM-5.2 相比,这次没有更换基座,能力提升全部来自后训练:更多长程任务环境、更丰富的任务类型和更多训练投入,重点强化 Coding、长程 Agent 与 Cyber 能力。
公开 Benchmark 上,提升明显:
Terminal-Bench 3.0:4.6 → 28.3
DeepSWE v1.1:46.2 → 66.9
Agents' Last Exam:23.8 → 28.5
GDPval-AA v2:1508 → 1769
GLM-5.3 的训练任务进一步向更完整的工程工作扩展。官方 ML Infrastructure Task 中,模型需要基于计算集群、存储、内部文档、代码库和实验结果,完成瓶颈分析、优化、实验与验证,最终交付可量化提速;部分任务规模相当于经验工程师数天的工作量。
技术上,重点是继续扩大真实、可执行、可验证的长程任务环境。官方通过 Research Agent、Judge Agent、Verifier 等 Pipeline 扩展这些环境,目前仍需要 Human-in-the-loop;Slime 的系统优化则让长程 Coding RL 端到端训练吞吐提升 2.3 倍以上。
Cyber 是另一大亮点。智谱在后训练中加入漏洞发现数据和相关环境后,观察到能力增长速度超出预期。CyberGym 从 77.2% 升至 84.5%,高于 Mythos 5 的 83.8% 和 GPT-5.6 Sol 的 83.6%;但在更深入的 ExploitBench 上,GLM-5.3 为 54.4%,仍低于两者的 78.0% 和 76.5%。
在真实代码库评估中,智谱与安全团队合作,经专家复核、筛选和去重后识别出 2,436 个漏洞,覆盖 269 个项目,其中 1,097 个为中高危。
成本方面,官方暂未公布标准 API Token 定价。GLM Coding Plan 采用积分制配额,工作日 14:00–18:00 为高峰时段,其他时间及周末点数消耗为标准的 50%。
GLM-5.3 已上线 ZCode、AutoClaw 和 GLM Coding Plan,也可在 Claude Code、OpenCode 等 Coding Agent 中使用。
官方已给出 glm-5.3 的 API 调用参数,Thinking 支持 low、high、max,默认和 Coding 推荐均为 max,且不再支持关闭 Thinking。完整模型权重计划发布两周后开放。






