Hugging Face 开源 multi-harness RL 训练方法
先了解这件事
2026年10月1日,Hugging Face 联创兼 CSO Thomas Wolf 在 X 上发布 multi-harness RL 训练指南,介绍一种可在 Claude Code、Codex、OpenCode 等实际使用的 agent harness 内部直接用强化学习训练任意模型于任意任务集的方法,声称无需改动 harness 或训练代码的任何一行。其展示的实验结果显示,在四个 harness 上训练后,LFM2.5-2.6B 模型得分从 42% 提升到 54%,同时 tool calls 减少 31%。10月2日,Hugging Face CEO Clément Delangue 多次发文推介该工作,称其为“重磅文章”,并指出同一模型同一权重在不同 agent harness 下得分可差至 62% 与 33%,凸显模型对特定接口的依赖。10月4日,Delangue 进一步说明,该多 harness 强化学习方法让同一开源权重模型在 Claude Code、Codex、OpenCode 和 Mini-SWE-Agent 四种 harness 中训练,以解决模型只学会特定接口的工具名、输出格式和控制流的问题,提升跨接口可移植性。10月5日,AK 转发指出 Hugging Face 将 Claude Code、Codex、Hermes、Pi、OpenCode 等编码 harness 变成 RL 训练环境并全部开源。
事件进展
报道时间线
- Hugging Face 将 Claude Code、Codex 等编码 harness 变成 RL 训练环境并开源
Hugging Face 团队把 Claude Code、Codex、Hermes、Pi、OpenCode 等编码 harness 变成了 RL 训练环境,不改动 harness 和训练代码,全部开源。
- Hugging Face 提出多 harness 强化学习提升模型跨接口可移植性
Hugging Face 研究人员提出多 harness 强化学习方法,让同一开源权重模型在 Claude Code、Codex、OpenCode 和 Mini-SWE-Agent 四种 harness 中训练,以解决模型只学会特定接口的工具名、输出格式和控制流的问题。
- Hugging Face CEO称赞团队作品
这是漂亮的工作 @huggingface! 🤗
- Hugging Face 开源多 harness RL 训练指南:同一模型不同 harness 得分差 62% 对 33%
Hugging Face 团队发布多 harness 强化学习完整指南,指出同一模型同一权重在不同 agent harness 下得分可差至 62% 与 33%。
- Hugging Face发文探讨RL训练编码智能体
宝贝,快醒。 Hugging Face 刚发了一篇关于在不同 harness 上用 RL 训练编码智能体的重磅文章。
- 开源 multi-harness RL 训练方法:在 Claude Code 等 harness 内直接训练模型
作者发布 multi-harness RL 指南,提供一种开放方式,可在 Claude Code、Codex、OpenCode 等实际使用的 agent harness 内部用 RL 训练任意模型于任意任务集,无需改动 harness 或训练代码的任何一行。在四个 harness 上训练后,LFM2.5-2.6B 从 42% 提升到 54%,同时 tool calls 减少 31%。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。