都说大模型拼参数,可智谱唐杰一句话点醒:参数本身啥也不是。
一个模型动辄几千亿参数,发布会报个数,大家就“哇”。但参数得配上三样东西才有意义,用了多少数据喂它、算力是怎么分配的、跑在什么样的硬件环境上。光堆参数,等于把发动机装自行车上,还指望它上高速。
真正有意思的是行业走过的弯路。2020年那帮科学家搞了个结论:参数增长速度得是训练数据的好几倍。于是GPT-3、Gopher这些大块头都沿着这条道狂奔,直到万亿参数出来,大家才发现资源全错配了。2022年Hoffmann他们重新做了四百个实验,才推翻此前的结论:参数和训练数据得同步增长,一个参数对应二十个token才是合理的分配。
回头看,万亿参数热潮像一场跟风闹剧。先有结论,再有验证,最后被证伪。这年头谁嗓门大不代表谁是对的,参数多也不代表模型聪明,方向错了,跑得越快错得越远。
