DC娱乐网

AI大模型里的“蒸馏”到底是在干什么? 1、大模型分为预训练和蒸馏微调两个阶段,两者算力需求天差地别 预训练就是从零搭建基础大模型,要庞大的算力集群、消耗大量GPU。国内头部厂商早已完成自有基础大模型的预训练,算力条件是达标的。 蒸馏微调是基础模型建好之后再优化打磨,这个环节需要的算力要 ​

AI大模型里的“蒸馏”到底是在干什么?

1、大模型分为预训练和蒸馏微调两个阶段,两者算力需求天差地别预训练就是从零搭建基础大模型,要庞大的算力集群、消耗大量GPU。国内头部厂商早已完成自有基础大模型的预训练,算力条件是达标的。蒸馏微调是基础模型建好之后再优化打磨,这个环节需要的算力要少很多。

2、不少企业会拿海外顶尖模型来做蒸馏,根源是优质指令数据稀缺搭建基础模型可以抓取网上海量文本。但想要模型流畅、精准地回答各类问题,就需要大量人工标注的“问题+标准答案”数据。人工标注成本很高,行业里的通行办法,就是调用成熟大模型产出优质问答数据当作训练素材,海外厂商同样这么操作,并不是国内特例。

3、这一行为和缺算力无关要是算力不够,我们连自研基础大模型都跑不出来。国内能做出千亿参数基础大模型,就证明算力底座已经成型。借用海外模型蒸馏,实际是为了获取高质量训练数据来优化对话表现。

不过这条路同样存在明显风险,这也是Anthropic收紧接口的主要原因:1.合规版权风险:拿Anthropic生成的数据训练自家商用模型,违反它的接口使用规则;2.能力存在天花板:被蒸馏出来的模型,性能很难超越作为范本的源模型,长期发展会被限制上限;3.知识偏差传导:源模型自带的错误认知、固有偏见,也会一并传递到新模型当中,造成数据污染。

总结:并不是国内算力跟不上,本质是高质量的推理训练样本很难拿到、成本太高,模型蒸馏是全球AI企业都在用的通用技术。