跳到正文
原文
huggingface· @huggingface · X·· 5 天前AI 评分72

Hugging Face 开源多 harness RL 训练指南:同一模型不同 harness 得分差 62% 对 33%

AI 导读

Hugging Face 团队发布多 harness 强化学习完整指南,指出同一模型同一权重在不同 agent harness 下得分可差至 62% 与 33%。

正文 · AI 翻译

同一个模型,使用相同的权重,在一个智能体框架下得分为 62%,而在另一个框架下只有 33%。

@adithya_s_k 和 @huggingface 团队刚刚发布了多框架强化学习的终极指南,这是今年最实用的强化学习文章之一,而且全部开源!

诀窍很简单。不要动框架本身,而是把它指向一个代理(proxy),而不是直接指向模型。这个代理支持编码智能体使用的全部四种 API 格式(OpenAI Chat Completions、OpenAI Responses、Anthropic Messages、Gemini)。它会记录 vLLM 采样得到的确切 token id 和 logprobs,你就在这些数据上训练。这样你一行代码都不用改 Claude Code、Codex 或 OpenCode。

结果:
🔹 同时在 4 个框架上训练,@liquidai 的 LFM2.5-2.6B 从 42% 提升到 54%
🔹 工具调用次数减少 31%,这得益于对用更少步骤完成任务的少量奖励
🔹 仅在 OpenCode 中训练,让 OpenCode 从 34% 提升到 58%,但多框架模型在所有框架上都有提升

他们还试了大家都会想到的捷径:用 Qwen3.8-27B 的 3,189 条成功轨迹做微调。模仿学习在 47.5% 就停滞了,低于两次强化学习的结果。照搬更大的模型并不能带你到达终点,练习才能。

最棒的是,一切都开源了:OpenEnv 中的采集代理、TRL 中的训练器、任务、SFT 数据、训练代码,以及全部七个训练好的模型。
智能体将会在几十种框架中运行。

现在,任何人都可以针对每一种框架训练开源模型。

在这里阅读 👇
huggingface.co/spaces/FineEn…

来源:huggingface · x.com