DC娱乐网

[LG]《Bridging Compute- and Data-Optimal

[LG]《Bridging Compute- and Data-Optimal Pretraining》T Qin, K Hamidieh, D Alvarez-Melis [Harvard University & MIT] (2026)

在预训练领域,高质量数据枯竭是核心难题。传统 Chinchilla 定律受困于数据无限供应的假设,本质原因是其无法量化在有限语料上追加计算投入所产生的边际收益。

本文的核心洞见是将重复或改写数据重新看作具有折扣的新鲜代币。引入代币有效性函数这一操作,揭示了数据价值随模型规模和数据密度增加而动态衰减的规律,使计算分配精细化。

这项工作统一了计算与数据最优的标度律。它为后来者打开了突破数据荒漠的帕累托前沿,明确了不同规模下的策略选择,但尚未跨过的门槛是仅凭语料统计特征预判数据价值。

arxiv.org/abs/2607.25271 机器学习 人工智能 论文 AI创造营