DC娱乐网

GLM-5.3编程能力提升50%,基座为何不换 8月14日,智谱正式发布GLM

GLM-5.3编程能力提升50%,基座为何不换
8月14日,智谱正式发布GLM-5.3,并称其编程能力较GLM-5.2提升50%。这次升级没有更换基座模型,主要增量来自后训练,这比单纯把参数做大更值得分清。
同一底座,训练重点换了 大模型升级常见的路径是增加参数、调整架构或重做预训练。GLM-5.3走的是另一条路:保留GLM-5.2的基座,把资源集中到后训练Scaling,让模型在编程任务上学会更好地规划、执行和修正。
预训练决定模型拥有哪些基础知识和语言能力,后训练则更像是教它如何在具体场景中使用这些能力。对编程Agent来说,知道语法只是起点,它还要学会先读哪些文件、什么时候调用工具、测试失败后怎么修改。后训练Scaling瞄准的正是这类执行行为。
基座: GLM-5.3没有以全新预训练模型起步,版本号变了,底层基础仍延续GLM-5.2。 方法: 智谱把这次能力增长归因于后训练Scaling,重点是模型在具体任务上的行为,而不是重建基础知识。 结果: 官方公布的编程能力提升幅度为50%,并将它定位为编程能力领先的开源模型。 这种升级方式的好处是,研发团队不必每一次都用更大的预训练账单换取能力增长。基座不变,也让新旧版本的差异更集中在任务表现,而不是同时叠加架构、知识和调用方式的变化。
对模型厂商来说,这还是一种更快的产品迭代方式。与重做一轮大规模预训练相比,围绕特定任务补后训练,更容易把资源集中在开发者使用频率高的环节。但这种路线也会让版本升级更加专项化,编程能力大涨,不代表所有能力会同比上升。
50%的适用范围在编程任务里 “提升50%”很容易被理解成所有问题都能快一半、准一半。但当前多家媒体复述的明确口径是“编程能力较GLM-5.2提升50%”,它不能直接外推到写作、检索、翻译或其他通用任务。
对开发者来说,这个数字至少要拆成三个问题:是一次代码生成的通过率提高,还是长任务完成率提高;是更少轮次就能完成,还是每轮消耗了更多Token;是对新项目有效,还是在真实代码库里也能维持。这些尺度决定了提升会不会变成实际开发效率。
因此,对GLM-5.3的实际评估不应只记一个50%。一项真实需求可以同时记录首次成功率、总Token消耗、工具调用失败次数和人工返工时间。如果通过率提高却消耗了更多轮次,那是能力进步;如果同时减少返工和Token,才会直接变成工程效率。
基座模型不换,并不意味着调用结果会与GLM-5.2保持一致。后训练改变的正是模型如何选择、排序和执行动作,原有提示词、工具调用和测试集仍然需要重新跑一遍。GLM-5.3这次要卖的,是同一套基础能力被重新训练后,能在编程链条上多走几步。