跳到正文
热点事件观察中

Hugging Face 开源 multi-harness RL 训练方法

6 篇报道3 个报道来源2 天前更新

先了解这件事

AI 综述

2026年10月1日,Hugging Face 联创兼 CSO Thomas Wolf 在 X 上发布 multi-harness RL 训练指南,介绍一种可在 Claude Code、Codex、OpenCode 等实际使用的 agent harness 内部直接用强化学习训练任意模型于任意任务集的方法,声称无需改动 harness 或训练代码的任何一行。其展示的实验结果显示,在四个 harness 上训练后,LFM2.5-2.6B 模型得分从 42% 提升到 54%,同时 tool calls 减少 31%。10月2日,Hugging Face CEO Clément Delangue 多次发文推介该工作,称其为“重磅文章”,并指出同一模型同一权重在不同 agent harness 下得分可差至 62% 与 33%,凸显模型对特定接口的依赖。10月4日,Delangue 进一步说明,该多 harness 强化学习方法让同一开源权重模型在 Claude Code、Codex、OpenCode 和 Mini-SWE-Agent 四种 harness 中训练,以解决模型只学会特定接口的工具名、输出格式和控制流的问题,提升跨接口可移植性。10月5日,AK 转发指出 Hugging Face 将 Claude Code、Codex、Hermes、Pi、OpenCode 等编码 harness 变成 RL 训练环境并全部开源。

AI 根据报道生成 · 2 天前更新

事件进展

3 个进展
  1. 10月5日 22:48 · 1 篇报道
    HuggingFace开源编码harness转RL环境方案
    AK:Hugging Face 将 Claude Code、Codex 等编码 harness 变成 RL 训练环境并开源
  2. 10月4日 20:30 · 1 篇报道
    Hugging Face 提出多 harness 强化学习提升模型跨接口可移植性
    Clément Delangue:Hugging Face 提出多 harness 强化学习提升模型跨接口可移植性
  3. 10月1日 23:43 · 4 篇报道
    开源 multi-harness RL 训练方法:在 Claude Code 等 harness 内直接训练模型
    Thomas Wolf:开源 multi-harness RL 训练方法:在 Claude Code 等 harness 内直接训练模型

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. X:AK (@_akhaliq)
    Hugging Face 将 Claude Code、Codex 等编码 harness 变成 RL 训练环境并开源

    Hugging Face 团队把 Claude Code、Codex、Hermes、Pi、OpenCode 等编码 harness 变成了 RL 训练环境,不改动 harness 和训练代码,全部开源。

10月4日
  1. X:Clément Delangue(Hugging Face CEO) (@ClementDelangue)
    Hugging Face 提出多 harness 强化学习提升模型跨接口可移植性

    Hugging Face 研究人员提出多 harness 强化学习方法,让同一开源权重模型在 Claude Code、Codex、OpenCode 和 Mini-SWE-Agent 四种 harness 中训练,以解决模型只学会特定接口的工具名、输出格式和控制流的问题。

10月2日
  1. X:Clément Delangue(Hugging Face CEO) (@ClementDelangue)
    Hugging Face CEO称赞团队作品

    这是漂亮的工作 @huggingface! 🤗

  2. X:Clément Delangue(Hugging Face CEO) (@ClementDelangue)
    Hugging Face 开源多 harness RL 训练指南:同一模型不同 harness 得分差 62% 对 33%

    Hugging Face 团队发布多 harness 强化学习完整指南,指出同一模型同一权重在不同 agent harness 下得分可差至 62% 与 33%。

  3. X:Clément Delangue(Hugging Face CEO) (@ClementDelangue)
    Hugging Face发文探讨RL训练编码智能体

    宝贝,快醒。 Hugging Face 刚发了一篇关于在不同 harness 上用 RL 训练编码智能体的重磅文章。

10月1日
  1. X:Thomas Wolf(Hugging Face 联创/CSO) (@Thom_Wolf)
    开源 multi-harness RL 训练方法:在 Claude Code 等 harness 内直接训练模型

    作者发布 multi-harness RL 指南,提供一种开放方式,可在 Claude Code、Codex、OpenCode 等实际使用的 agent harness 内部用 RL 训练任意模型于任意任务集,无需改动 harness 或训练代码的任何一行。在四个 harness 上训练后,LFM2.5-2.6B 从 42% 提升到 54%,同时 tool calls 减少 31%。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。