DC娱乐网

Agentic RL 系列(下):Evolving-RL

大家好,我是居丽叶。
前两篇分别解决了两个问题:Agentic RL 把模型放进可执行、可判分、可回放的环境,用完整 Trajectory 训练行动策略;SkillRL 再把历史轨迹蒸馏成结构化 Skill,通过 SkillBank 帮 Agent 在相似任务上少走弯路。

可当经验系统真正运行起来,还会撞上一堵墙:谁来保证提炼出的 Skill 有用?

同一条失败轨迹,有的模型能总结出“操作设备前先确认目标物体在 inventory 中”;有的模型只会写一句“下次要更仔细”;还有的模型会从偶然现象里归纳出错误规则。三段文字都像总结,迁移到新任务后的效果可能完全相反。

Evolving-RL 的 Figure 1 给了一个很直观的结果:给 Base Model 注入自身提炼的 Skill,ALFWorld Overall Success Rate 从 45.5 降到 44.5;注入 Evolving-RL 学出的 Skill 后,提升到 60.4。对 GRPO 策略,Skill 注入也从 79.9 提升到 88.8。
这说明 Skill 并不会天然带来收益。低质量经验会占用上下文、干扰决策,模型最稳妥的应对甚至是学会忽略它。

Evolving-RL 因此把 Skill 的生成也纳入强化学习:提炼出的 Skill 要在下游任务中接受检验,测试结果再同时更新 Extractor 和 Solver。