DC娱乐网

一杯奶茶完成Search-R1的探索性复现 最近做了一次小规模的 Search-

一杯奶茶完成Search-R1的探索性复现
最近做了一次小规模的 Search-R1 探索性复现。
这次不是严格复刻论文,而是想熟悉Agentic RL并同时验证一个简单的问题:Qwen3.5-4B 本来已经会调用搜索工具,如果只根据最终答案发奖励,能在多大程度上改变它原有的搜索习惯?
实验环境比较轻量:
- Qwen3.5-4B + LoRA
- 240 道训练问题
- 固定 70 道评测题
- 30 步训练,共生成 1,920 条轨迹

第一轮只奖励答案正确,不考虑搜索次数。训练后,准确率从 34.29% 提升到 42.86%,格式正确率也从 62.86% 提升到了 100%。但继续分析轨迹时,我发现了一个有意思的现象:答对问题的轨迹,平均搜索次数反而从 1.92 增加到了 2.10。原因很直接,搜索 1 次答对和搜索 4 次答对都拿 1 分,模型自然没有动力节省调用。

第二轮,我只对正确答案收取每次 0.02 的搜索成本。错误轨迹不扣搜索费,避免模型为了少搜索而直接猜答案。
最终结果:
准确率:34.29% → 40.00%
平均搜索:2.36 → 1.47 次
总搜索次数:165 → 103
搜满 4 次的问题:22 → 1
61.4% 的问题只需要搜索 1 次
这并不意味着“搜索越少越好”。更准确地说,模型开始把搜索当成一种有限预算:先保证答案正确,再尝试用更少的调用完成任务。

真正让我印象深刻的,是短短 30 步训练就能明显改变模型分配搜索能力的方式。这也让我再次意识到,RL 的关键不只是让模型拿到更高的奖励,而是确保奖励真正对应我们期望的行为。
暑期实习时,我接触过一些业务场景下的后训练任务。由于训练数据覆盖不均,部分行为缺少足够约束;奖励函数又只能近似表达真实的业务目标,模型很容易找到“分数更高、实际行为却不一定更好”的捷径——这就是典型的 reward hacking。

不过,个人进行这类探索的成本确实不低,因此这次只训练了 30 步,固定评测也只有 70 道题。目前的结果更适合用来验证思路、观察趋势,还不足以得出高置信度结论。

后续会继续分享 RL 探索记录 & 27届秋招记录 ~~

大模型 后训练 强化学习 AgenticRL 搜索智能体 SearchR1 PyTRIO Qwen 复现记录