[LG]《Reinforcement Learning for Code Optimization》P Chambon, K Zheng, J Decugis, B Sagot… [FAIR at Meta] (2026)
在代码生成领域,训练出既正确又高效的模型是一个悬而未决的难题。过去的方法受困于执行时间测量的噪声、奖励信号极其稀疏以及训练过程的不稳定性,本质原因是标准强化学习(RLVR)难以在波动较大的执行环境中捕捉到微弱的性能改进信号。
本文的核心洞见是:把代码优化重新看作一个可学习的阶段性蒸馏过程。由此,构建包含大规模压力测试的 DMC-Optim 数据集、利用校准沙盒消除测量噪声,并配合改进的 GRPO 算法进行多阶段奖励建模,这一关键操作使模型能够从稀疏且有噪声的耗时反馈中识别出真正的算法改进。
这项工作真正留下的遗产是证明了代码的“正确性”与“高效性”可以通过精心设计的 RL 框架实现解耦与协同。它为后来者打开的新门是利用自动化反馈发现人类专家级别的算法优化技巧(如复杂度降级),但尚未跨过的门槛是处理超大规模仓库级代码优化时面临的极高计算成本与环境模拟复杂度。
arxiv.org/abs/2607.25970 机器学习 人工智能 论文 AI创造营





