omarsar0· @omarsar0 · X·· 2 天前AI 评分
CMU 论文提出用 RL 训练模型改写 agent harness 代码
DAIR.AI 转发 CMU 关于 harness learning 的论文,作者用 RL 训练一个 proposer 模型,读取任务、当前 harness 和执行报告后直接写出 harness 代码修改,奖励是修改后 harness 的得分,solver 模型保持不变。
卡内基梅隆大学(CMU)关于 harness 学习的论文,太炸了。
(收藏一下)
另外,请注意这个重要的 AI 工程新技能:通过编辑智能体的 harness 代码(而非权重)来改进智能体。
我看到这方面的巨大转变。
作者用强化学习训练了一个 proposer 模型,让它阅读任务、当前的 harness 以及执行报告,然后写出对 harness 的代码修改。
奖励是修改后 harness 的得分。solver 模型始终保持不变。
一个训练好的 4B proposer 在 Reasoning Gym 的单步修改任务上击败了其 35B 的老师模型,包括它在训练中从未见过的任务族。在 HotpotQA 上训练的 proposer 能持续改进 MuSiQue 和 2WikiMultihopQA 上的 harness。
论文:arxiv.org/abs/2609.35738
与论文对话:academy.dair.ai/papers/harne…
来源:omarsar0 · x.com