跳到正文
原文
omarsar0· @omarsar0 · X·· 2 天前AI 评分61

CMU 论文提出用 RL 训练模型改写 agent harness 代码

AI 导读

DAIR.AI 转发 CMU 关于 harness learning 的论文,作者用 RL 训练一个 proposer 模型,读取任务、当前 harness 和执行报告后直接写出 harness 代码修改,奖励是修改后 harness 的得分,solver 模型保持不变。

正文 · AI 翻译

卡内基梅隆大学(CMU)关于 harness 学习的论文,太炸了。

(收藏一下)

另外,请注意这个重要的 AI 工程新技能:通过编辑智能体的 harness 代码(而非权重)来改进智能体。

我看到这方面的巨大转变。

作者用强化学习训练了一个 proposer 模型,让它阅读任务、当前的 harness 以及执行报告,然后写出对 harness 的代码修改。

奖励是修改后 harness 的得分。solver 模型始终保持不变。

一个训练好的 4B proposer 在 Reasoning Gym 的单步修改任务上击败了其 35B 的老师模型,包括它在训练中从未见过的任务族。在 HotpotQA 上训练的 proposer 能持续改进 MuSiQue 和 2WikiMultihopQA 上的 harness。

论文:arxiv.org/abs/2609.35738

与论文对话:academy.dair.ai/papers/harne…

来源:omarsar0 · x.com