rohanpaul_ai· @rohanpaul_ai · X·· 2 天前AI 评分
Nvidia 论文提出 VERA:交替训练模型与编辑技能文件让长流程 Agent 提升最大
Nvidia 新论文提出 VERA,让长多步任务的 Agent 交替进行模型训练与技能文件编辑,并用真实证据的逐步打分决定每次修改方向。论文称只训练模型或只改 harness 会损失约一半收益;VERA 将 benchmark 运行转成 9,000 多个可重启沙盒,逐步对照真实文件和日志打分。
英伟达(Nvidia)的一篇新论文显示,对于执行长时程、多步骤任务的智能体,交替进行模型训练和技能文件编辑,能带来最大的改进;每次修复都依据真实证据产生的逐步评分来决定。
与交替更新两者相比,只训练模型或只改进运行框架(harness),大约一半的提升效果都会损失掉。
大多数环境只对最终结果评分,这掩盖了究竟是哪一步出了问题。VERA 构建了 9,000 多个可重启的沙箱,用真实文件和日志检查每一步,然后分轮次改进智能体。
VERA 将基准测试运行转化为 9,000 多个可重启的沙箱,长工作流的每一步都会根据真实证据获得各自的检查清单评分。
在一个医学研究基准测试中,一个 9B 智能体在同时进行两种更新时得分为 69.1,而仅编辑技能时为 56.1,仅训练时为 43.3。
根据真实产物对每一步进行评分,并让这些评分决定下一次修复是改进模型还是改进其技能。
来源:rohanpaul_ai · x.com