DC娱乐网

OpenForgeRL: 任何环境下训练工具原生代理 这篇论文试图解决如何在真实

OpenForgeRL: 任何环境下训练工具原生代理
这篇论文试图解决如何在真实、复杂的推理框架(inference harnesses)中对AI agent进行端到端训练这一核心问题,具体而言,是弥合开源RL训练基础设施与现代agent部署环境之间的系统性鸿沟。
论文指出,当前存在以下几个关键障碍:
训练栈无法原生表达复杂 harness 推理:现代agent(如Claude Code、Codex、OpenClaw)被包裹在复杂的有状态推理框架中,涉及多轮交互、嵌套工具调用、子agent和长期上下文管理。然而,现有的开源SFT/RL框架(如veRL、Slime)假设训练器能直接控制模型的prompt和生成过程,无法原生支持这些多进程、状态化的 harness 推理流程。
计算环境无法共存:复杂 harness 的rollout需要独立的容器化环境(配备专用CPU和内存),无法与GPU训练节点在同一台机器上大规模共存。现有RL框架通常假设rollout在训练器本地运行,这导致复杂环境难以扩展。
训练-部署不匹配(train–deploy mismatch):由于上述限制,开源社区往往只能在为训练而重新实现的简化版 harness 中进行训练,而非在模型实际部署时使用的真实 harness 中训练。这种不匹配限制了模型学习真实部署场景下的行为,也使得研究者难以在真实环境中研究和改进agent。
因此,论文旨在构建一个开放、可扩展的训练基础设施(OPENFORGE RL),通过轻量级代理和Kubernetes远程容器编排,将任意 harness 与任意环境连接到标准RL代码库,从而实现在真实部署设置中进行端到端的SFT和RL训练。

机器学习 深度学习 科研学习 人工智能发展 提供思路和创新点 大模型 人工智能 未来科技趋势