CMU与JHU论文:用RL训练模型改写agent harness
先了解这件事
AI 综述
2026年10月4日,DAIR.AI在X上转发CMU一篇关于harness learning的论文。论文提出用强化学习(RL)训练一个proposer模型:该模型读取任务、当前harness和执行报告后,直接写出harness代码的修改,奖励信号为修改后harness的得分,而solver模型保持不变。2026年10月6日,Rohan Paul在X上发布后续报道,称该研究为Johns Hopkins与CMU的合作论文,指出一个4B小模型通过学习失败报告来改写agent的harness代码,并可迁移到新任务。早先报道称该研究来自CMU,后续报道称作者单位为Johns Hopkins与CMU两校合作。
事件进展
2 个进展
报道时间线
10月6日
- Johns Hopkins 与 CMU 论文:4B 小模型可学会改进 Agent harness 代码并迁移到新任务
Johns Hopkins 与 Carnegie Mellon University 的新论文显示,一个 4B 小模型通过学习失败报告来改写 agent 的 harness 代码,可迁移到新任务。
10月4日
- CMU 论文提出用 RL 训练模型改写 agent harness 代码
DAIR.AI 转发 CMU 关于 harness learning 的论文,作者用 RL 训练一个 proposer 模型,读取任务、当前 harness 和执行报告后直接写出 harness 代码修改,奖励是修改后 harness 的得分,solver 模型保持不变。