DC娱乐网

大模型落地不用堆参数:三个增效潜点

最近和不少布局AI落地的企业负责人聊,发现大家选大模型的第一个问题永远是参数有多少,默认参数越大效果越好,最后预算砸下去不少,实际跑业务的时候效果没达标,钱全花了冤枉地方。过去三年整个大模型行业对缩放定律的认知已经迭代了三轮,参数只是影响大模型效果的变量之一。

最早2020年Kaplan团队发布的研究结论,一度把整个行业带向堆参数的方向。当时的结论是参数增速要比训练数据快,比例大概是2.7比1,随后GPT-3、Gopher、MT-NLG等模型都顺着这个思路做,不断拉高参数规模。

2022年Hoffmann团队做了更全面的测试,跑了四百多个不同配置的模型,最终发现计算资源最优的分配方式是每个参数对应20个训练tokens,参数和训练数据应该保持相同的增速,同等总算力投入下,按照这个比例训练的模型,效果远好于盲目堆高参数。之前那批万亿参数的大模型,现在回头看就是全行业共同走的一段弯路,之后各家的训练策略都做了调整。
Chinchilla提出的训练最优比例,只是缩放定律迭代的一个中间节点。早期的最优比例只考虑了单次训练的成本,现在绝大多数落地的大模型,每天要被调用几千万甚至上亿次,推理成本已经占到模型全生命周期成本的七成以上,优化方向自然会发生变化。