最早2020年Kaplan团队发布的研究结论,一度把整个行业带向堆参数的方向。当时的结论是参数增速要比训练数据快,比例大概是2.7比1,随后GPT-3、Gopher、MT-NLG等模型都顺着这个思路做,不断拉高参数规模。
2022年Hoffmann团队做了更全面的测试,跑了四百多个不同配置的模型,最终发现计算资源最优的分配方式是每个参数对应20个训练tokens,参数和训练数据应该保持相同的增速,同等总算力投入下,按照这个比例训练的模型,效果远好于盲目堆高参数。之前那批万亿参数的大模型,现在回头看就是全行业共同走的一段弯路,之后各家的训练策略都做了调整。
Chinchilla提出的训练最优比例,只是缩放定律迭代的一个中间节点。早期的最优比例只考虑了单次训练的成本,现在绝大多数落地的大模型,每天要被调用几千万甚至上亿次,推理成本已经占到模型全生命周期成本的七成以上,优化方向自然会发生变化。




