DC娱乐网

大模型强化学习已有成熟思路 目前主要在做的是大模型强化学习方向,已有成熟思路和初

大模型强化学习已有成熟思路
目前主要在做的是大模型强化学习方向,已有成熟思路和初步baseline,计划进一步推进并投稿相关顶会。

🤝 合作方式
你可以作为一作或共一(具体视贡献而定)
主要欢迎想要有科研产出的本硕博加入,一起合作完成。

✅ 希望你具备以下条件
1.对强化学习、序列决策、过程奖励或LLM对齐有一定基础
2.Coding 能力扎实,科研态度认真
3.时间充裕 & 自驱力强