跳到正文
原文
akshay_pachaar· @akshay_pachaar · X·· 2 天前AI 评分67

Hugging Face 提出多 harness 强化学习提升模型跨接口可移植性

AI 导读

Hugging Face 研究人员提出多 harness 强化学习方法,让同一开源权重模型在 Claude Code、Codex、OpenCode 和 Mini-SWE-Agent 四种 harness 中训练,以解决模型只学会特定接口的工具名、输出格式和控制流的问题。

正文 · AI 翻译

HuggingFace 刚刚填补了 harness 工程领域的一大空白!

(多 harness 强化学习终极指南)

同一个开源权重模型在一个 harness 中可能表现出色,但换到另一个 harness 后,就可能精度下降或产生无效的工具调用。

这是因为在一个特定接口内训练,会教会模型该接口特有的工具名称、输出格式、上下文结构和控制流。模型学到的是如何操作这个 harness,而不仅仅是如何解决任务本身。

Hugging Face 的研究人员测试了一种更具可移植性的方法,称为多 harness 强化学习。他们不是通过单一的智能体接口来训练模型,而是同时通过 Claude Code、Codex、OpenCode 和 Mini-SWE-Agent 进行训练。

为了实现这一点,他们连接了三个开放系统。

→ 𝗢𝗽𝗲𝗻𝗘𝗻𝘃 在智能体 harness、强化学习环境和训练器之间提供了标准接口。其捕获代理位于 harness 和模型服务器之间,记录训练所需的确切 token 和生成概率。

→ 𝗛𝗮𝗿𝗯𝗼𝗿 在容器化任务上运行智能体。它使任务、harness 和沙箱相互独立,允许同一个任务通过不同的 harness 尝试,而无需重建环境。

→ 𝗧𝗥𝗟 是 Hugging Face 用于语言模型后训练的开源库。它利用 𝗢𝗽𝗲𝗻𝗘𝗻𝘃 捕获的轨迹,通过强化学习来更新模型。

真正的突破在于训练数据的捕获方式。

每个 harness 都保留其原生的工具、提示词、上下文管理、重试机制和执行循环。研究人员不会在训练器中重新创建这些行为。𝗢𝗽𝗲𝗻𝗘𝗻𝘃 观察流经每个真实 harness 的模型调用,并将其转换为可用的训练序列。

团队在所有四个 harness 上训练了 𝗟𝗙𝗠𝟮.𝟱-𝟮.𝟲𝗕。在留出任务上首次尝试即成功的比例从 42.2% 提高到 54.2%,且在每个 harness 下都有提升。

在模型和基座模型都能解决的任务上,训练后的模型使用的工具调用减少了 31%。

仅在 OpenCode 中训练也能提升模型,但大部分提升都集中在 OpenCode 上。多 harness 训练则将改进分散到了各个接口。

该实验使用了单一任务族、单一训练种子以及不均衡的数据暴露,因此结果并非普适的排名。尽管存在这些局限,其机制仍然很重要。

开源模型不能假设只有一个部署接口。如果它们需要在不同 harness 之间工作,那么这种可移植性就必须成为训练的一部分。

在此阅读完整指南:huggingface.co/spaces/FineEn…

如果你想了解 harness 工程以及智能体 harness 实际包含的内容,我写了一篇完整的解析来帮助你入门。文章引用如下。

来源:akshay_pachaar · x.com