DC娱乐网

不是所有尝试都值得训练 训练推理大模型时,同一道题会生成很多回答轨迹(rollo

不是所有尝试都值得训练
训练推理大模型时,同一道题会生成很多回答轨迹(rollouts),再用 GRPO 更新模型。《Not All Rollouts are Useful》指出:真正昂贵的不是生成,而是更新。

生成回答可并行;模型更新却需要同步、反向传播和大量显存。若所有轨迹都参与更新,计算会浪费在重复或低信息样本上。
论文提出 PODS:先并行生成大量 rollouts,再只挑“信息最丰富”的子集训练。
怎么挑?核心是 max-variance down-sampling。它不只看回答对不对,而是优先保留奖励信号差异最大的样本组合。不要选一堆都正确或都错误的回答;更有价值的是保留能体现“哪里做对、哪里做错”的多样尝试。
可以把它想成批改作业:十份相同的满分卷,新增信息很少;几份不同类型的错误卷,更有价值。
作者将 PODS 接入 GRPO,在数学推理基准和不同硬件配置上测试。达到普通 GRPO 的峰值测试准确率,至少快 1.7 倍;有些设置下,最终效果还更好。
启发不只适用于 LLM 强化学习:训练预算有限时,“多采样”和“全训练”可以分开。前者扩大探索,后者聚焦高信息密度样本。
一句话:不是每次模型尝试都该反向传播;选对值得学习的尝试,可能比盲目堆更多 rollout 更有效。
大模型推理轨迹 强化学习 GRPO优化 LLM训练 后训练 人工智能顶会顶刊 rollouts