我看智谱的创始人唐杰在 X 上发了一个关于尺度律的思考。
我简单翻译一下。具体什么意思呢?
很多人一听到大模型,第一反应就是问:它有多少参数?
参数可以简单理解成模型的“脑容量”。参数越多,模型通常能装下更多知识,但这并不能单独决定模型有多聪明。还要看它读了多少训练资料,训练时用了多少算力,以及以后会被调用多少次。
人工智能行业以前就因为只盯着参数量,走过一段弯路。2020年的一项研究认为,模型参数应该比训练数据增长得更快,比例大约是2.7比1。于是很多公司开始不断把模型做大,甚至冲向万亿参数。
后来,研究人员重新比较了大约400个模型,发现更划算的做法,是让训练数据也跟上模型规模。大致来说,每个参数需要对应约20个词元,也就是训练文字中的小片段。参数和数据最好一起增长,不能只顾着扩大模型。
后来大家又发现,训练成本只是问题的一部分。现在,一个模型每天可能被调用几十亿次,真正长期花钱的地方,常常是模型回答问题时产生的推理成本。这样一来,小一些的模型,如果接受更长时间、更充分的训练,可能比一个特别大的模型更实用。Llama 2 7B和Gemma 2 9B就体现了这种思路。
采用MoE架构的模型,还要区分两类参数。总参数更像“知识仓库”,决定模型能装下多少事实和冷门信息。每次真正被调用的参数,以及模型能连续思考多少步,更影响它的推理能力。研究发现,记忆知识可能需要更多参数,复杂推理则更需要训练数据和更长的思考过程。
比如,发现一个软件漏洞,不只是从资料库里找答案。模型需要把一连串推理完整走下去,中间不能忘记前面的线索,这种能力无法只靠增加总参数获得。
GLM 5.3做了一个很有意思的实验。它和GLM 5.2的基础模型、架构、总参数量都差不多,主要用了一个月时间加强长流程训练和强化学习,也就是让模型在反复练习中获得反馈。结果能力提升很明显。
这说明,大模型还有很多地方可以继续扩大。参数量只是其中一个旋钮,训练数据、推理算力、训练方式和强化学习都很重要。下一次进步,关键在于找到最值得继续投入的那个方向。
#科技先锋官##How I AI#
