多模态预训练内部,到底发生了什么物理规律?
Meta FAIR×牛津论文。
第一作者 Junlin Han同时属于 Meta FAIR和牛津。通讯作者之一 Philip Torr牛津教授计算机视觉领域的大牛。这篇要训13.5B、2T token,没有 Meta 的算力根本做不了。Reality Labs也参与了。做的事情很硬核,不是发模型,而是想搞清楚"多模态预训练"内部到底发生了什么"物理规律"。四个洞察也写在标题上:Knowledge Flow, Modality Synergy, Early Unification, and Recipes。
(一)知识流动: 厘清了语言、视觉理解、视觉生成三者之间是如何跨模态传递知识的。这三种能力之间知识如何流动,目前仍不完全清楚,而且近期的研究经常得出不同的结论。核心方法是受控混合实验。用到RAE、Raw Pixels、CLIP+VAE 是几种不同视觉编码器解码器,大大提升了结论的分量。在一个程序化生成的合成基准上重做了这套分析。合成数据的设置,让我们能够随意移除或插入特定概念,并进行逐概念的评估,这两者结合起来,就把真实数据上的相关性发现,转化成了关于模态传递的因果性结论。在真实数据上,你只能得出相关性:"加了语言,视觉变好了",但不能100%确定是语言导致的,可能别的因素。在合成数据上,能精确地"这个概念加进去"、还能单独评估,就能做到:"我改了这一个变量,结果变了,那就一定是这个变量导致。为什么说模态知识流动不对称?语言,是所有视觉任务的"万能助推器",视觉理解是生成能力的"强大基础",然而,视觉生成,对其他能力只产生中性影响。看来"搞懂知识怎么流动"能直接指导"该怎么训"。
(二)协同vs竞争: 数据的"复杂度"在很大程度上起决定性因素。足够复杂时,它们才开始互相帮忙。这解释了为什么有时候"加一个模态反而变差",因为数据不够复杂,它们在竞争而不是协同。团队给出了能促进协同的架构:共享注意力和归一化层,但为每个模态保留各自专属的前馈层。很多人只讲了"原生融合""统一架构"这种笼统说法,不说具体怎么共享、怎么分层。
(三)早期统一: 从最早的阶段就把各模态统一训练,被证明比"后期对齐"或"顺序训练"更有效。有个"视觉懒惰"现象:如果推迟视觉的整合,模型会变得依赖语言先验。就是学好的语言知识去猜答案,而不是看图。
(四)配方: 好配方5%的算力就达到了强性能。




