[LG]《Neural Quadratic Forms: A Unified Minimal Model for Sudden Learning and Scaling Laws》L Ziyin, Y Xu, T Poggio, I Chuang [MIT & EPFL] (2026)
在神经网络学习动力学中,训练损失同时呈现阶梯式突降与平滑幂律缩放,构成了一个核心矛盾。过去的方法孤立研究各类架构,受困于其细节差异,本质原因是缺乏一个能统一解释这两种现象的简约模型。
本文的核心洞见是:把不同架构的初始学习阶段重新看作一个统一的“神经二次型”模型。由此,利用网络组件的置换对称性在权重原点展开,将所有架构差异压缩进一个“结构矩阵”——这一关键操作使复杂的动力学方程得以统一。
这项工作真正留下的遗产是,一个基于对称性的物理模型,为突变学习和缩放定律提供了共同起源。它为后来者打开的新门是:通过计算“结构矩阵”来预测新架构的学习行为,但尚未跨过的门槛是该模型在训练后期大权重阶段的有效性。
arxiv.org/abs/2608.13335 机器学习 人工智能 论文 AI创造营








