跳到正文
热点事件持续更新

CMU与JHU论文:用RL训练模型改写agent harness

2 篇报道2 个报道来源10 小时前更新

先了解这件事

AI 综述

2026年10月4日,DAIR.AI在X上转发CMU一篇关于harness learning的论文。论文提出用强化学习(RL)训练一个proposer模型:该模型读取任务、当前harness和执行报告后,直接写出harness代码的修改,奖励信号为修改后harness的得分,而solver模型保持不变。2026年10月6日,Rohan Paul在X上发布后续报道,称该研究为Johns Hopkins与CMU的合作论文,指出一个4B小模型通过学习失败报告来改写agent的harness代码,并可迁移到新任务。早先报道称该研究来自CMU,后续报道称作者单位为Johns Hopkins与CMU两校合作。

AI 根据报道生成 · 10 小时前更新

事件进展

2 个进展
  1. 10月6日 07:31 · 1 篇报道
    小模型学习改写Agent harness代码并迁移新任务
    Rohan Paul:Johns Hopkins 与 CMU 论文:4B 小模型可学会改进 Agent harness 代码并迁移到新任务
  2. 10月4日 07:38 · 1 篇报道
    CMU提出通过编辑harness代码改进Agent的方法
    DAIR.AI:CMU 论文提出用 RL 训练模型改写 agent harness 代码

报道时间线

沿着报道,了解事件的不同侧面。

10月6日
  1. X:Rohan Paul (@rohanpaul_ai)
    Johns Hopkins 与 CMU 论文:4B 小模型可学会改进 Agent harness 代码并迁移到新任务

    Johns Hopkins 与 Carnegie Mellon University 的新论文显示,一个 4B 小模型通过学习失败报告来改写 agent 的 harness 代码,可迁移到新任务。

10月4日
  1. X:DAIR.AI (@dair_ai)
    CMU 论文提出用 RL 训练模型改写 agent harness 代码

    DAIR.AI 转发 CMU 关于 harness learning 的论文,作者用 RL 训练一个 proposer 模型,读取任务、当前 harness 和执行报告后直接写出 harness 代码修改,奖励是修改后 harness 的得分,solver 模型保持不变。

本事件热度走势

当前热度 8·可比范围峰值 10(10月6日 08:00)·近 24 小时可比范围变化 –

02.557.51010月5日19:0010月6日02:0010月6日10:0010月6日17:00

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。