DC娱乐网

唐杰:大模型竞争,从拼参数转向找瓶颈

唐杰最近谈 Scaling Law,提出了一个很重要的判断:

AI没有停止 Scaling,只是 Scaling 的对象早已不止参数。

过去几年,行业习惯用参数量衡量模型实力。参数越大,似乎就代表能力越强。

但这套逻辑已经被修正过多次。

早期研究鼓励行业快速扩大参数;Chinchilla 后来发现,许多大模型其实训练数据不足。推理成本成为大头后,更小、训练更久的模型又可能更加划算。到了 MoE,模型有多少总参数,和每次真正激活多少参数,也成了两回事。

所以,Scaling Law 的本质更像一道投资题:

下一份算力投给参数、数据、单次推理,还是后训练,收益最高?

唐杰把 GLM-5.3 称为一次后训练方向的对照实验。按照他的介绍,它与 GLM-5.2 使用相同的基础模型、架构和参数规模,只增加了一个月的长时程环境与强化学习训练。唐杰称,这个变化带来的提升并不小。

这个实验指向了一个更重要的行业变化:

大模型竞争正在从“谁拥有更多参数”,转向“谁能更快找到真正的瓶颈”。

参数规模可以追赶,最难复制的是诊断能力:模型究竟缺知识、缺推理深度,还是缺少在复杂环境中持续行动的训练?

找错问题,多堆一千亿参数也可能只是更昂贵的浪费。

下一代AI公司的核心能力,或许不是把一个数字做得更大,而是知道下一块GPU应该烧在哪里。

#人工智能 #大模型 #ScalingLaw #唐杰 #GLM #机器学习