字节跳动内部严禁蒸馏开源模型
最近字节跳动内部定下的这条技术红线,看完之后感慨良多。坦白来讲,这种甘愿舍弃速成捷径、执意抢占底层技术高地的抉择,大概也只有字节这种家底厚实的行业巨无霸才有底气去践行。商业世界向来现实,任何一家企业活下去都需要消耗氧气。放眼当下国内AI赛道,遍地都是生存压力。绝大多数中小型AI创业团队背负着高昂的算力开销、数据集成本、融资周期的重压。对于他们来说,模型蒸馏从来都算不上投机取巧,更像是艰难求生的救命通道。
依靠成熟开源大模型的输出结果训练自身底座,可以跳过漫长且失败率极高的底层试错,用很低的成本快速拉高跑分、做出能够交付客户的产品。当首要目标是存活、抢占市场份额的时候,几乎很少有人愿意耗费巨额资金死磕原生预训练。怀揣长远技术理想的企业,终究只是少数。也正是因为如此,字节主动给自己设下枷锁、禁止团队蒸馏一切外部开源模型这件事,才更加难得。很多网友对此抱有疑问:蒸馏只是一项常规工程技术,大厂也常会拿自家旗舰模型蒸馏轻量化小模型用于落地部署,为何要一刀切禁止借鉴外部开源成果?
我十分认同字节这份战略判断:倘若AI研发长久依赖蒸馏,行业本质上便很难诞生真正的原生创新。
蒸馏通俗来讲,就是复刻别家模型已经梳理完毕的答案与推理思路。研发团队只需要投喂海量问题,收下成熟大模型给出的回答,便可快速训练出新模型。这条路走通之后,工程师便不需要亲身钻研高质量原始语料、优化预训练架构、调试对齐链路,不必熬过底层研发漫长枯燥的试错过程。
一个习惯了背诵别人标准答案的研发团队,很难再独立开辟全新的技术方向。蒸馏而来的模型上限永远受制于“老师模型”,你只能复刻别人已经摸索出来的能力,很难突破现有的技术天花板。当整个行业全都热衷于这条捷径,所有人都站在前人的成果之上偷懒,突破性的底层创新便会慢慢绝迹。纵观现如今整个AI行业的发展趋势,眼下正处在竞速内卷向着底层比拼的分水岭。前两年行业的主旋律是速度竞赛:各家争相发布新版本、冲刺测评榜单、比拼跑分数据、抢占C端和企业客户。蒸馏技术刚好适配这个阶段,压低入场门槛,加速AI能力普及,无数创业公司依靠捷径缩小和头部厂商之间的差距。
可是赛道发展至今,浅层竞速已经走到瓶颈。如今开源模型遍地开花,各家成品的日常对话能力差距越来越小,同质化内卷越发严重。往后拉开差距的,只会是独属于企业本身的数据集沉淀、独创的模型架构、底层预训练经验、专属的工程体系。
行业之后一定会分出两条道路:求生型企业继续依靠蒸馏快速迭代商用产品,优先保障营收生存;具备充足资金储备的头部巨头,则开始放弃捷径,扎根底层自研,修筑起别人无法复刻的技术护城河。当然我们也需要客观看待争议,网上反对的声音同样具备现实依据。不少从业者担忧硬性禁令会拖慢字节短期迭代速度,在当下白热化的榜单比拼之中暂时落后竞品;也有人认为开源模型本就对外开放授权,学习开源成果无可厚非。
但张一鸣已经表态,Seed团队可以接受短期落后,却不能接受研发惰性。字节此举并不是全盘否定蒸馏这项工具,内部依旧允许蒸馏自家产出的基座模型制作轻量化版本;它拒绝的只是依附外人成果的拿来主义。
更深一层来看,这份决定同样包含长远的风险考量。字节旗下的TikTok常年面对海外严苛的AI监管审查,一旦外部检测出模型复刻海外顶尖大模型,很容易被当成把柄遭受限制。从源头杜绝外部模型蒸馏,也是提前规避地缘层面的隐患。说到底,捷径可以赢得一时的跑分,却赢不下未来通用人工智能的赛道。当行业所有人都贪图轻松的捷径,便没有人愿意走那条崎岖的原创长路。字节这次带着代价的选择,也是在给浮躁的AI行业敲响警钟:创新永远不能依靠复制别人的思考。
