rohanpaul_ai· @rohanpaul_ai · X·· 23 小时前AI 评分
Johns Hopkins 与 CMU 论文:4B 小模型可学会改进 Agent harness 代码并迁移到新任务
Johns Hopkins 与 Carnegie Mellon University 的新论文显示,一个 4B 小模型通过学习失败报告来改写 agent 的 harness 代码,可迁移到新任务。
约翰霍普金斯大学和卡内基梅隆大学的新论文表明,一个小模型可以学会根据运行结果改进智能体的 harness 代码,而且这项技能可以迁移到新任务上。
一个经过训练、能根据失败报告重写智能体 harness 代码的小模型,可以让智能体适应新任务,所以不妨让它来调优你的 harness,而不是手动修改。
harness 是决定模型能看到什么、调用哪些工具的代码。编辑器会阅读 harness 和失败信息,然后写出代码改动,其奖励取决于新 harness 的得分表现。
在 21 类未见过的推理任务上,一个 4B 编辑器的平均编辑得分从 0.32 提升到 0.62,超过了它的 35B 教师模型。另一个在 HotpotQA 上训练的编辑器,在另外 2 个 QA 基准上持续改进 harness。
每个任务多跑几轮,因为反复编辑比单次修复效果更好。
来源:rohanpaul_ai · x.com