跳到正文
原文
dair_ai· @dair_ai · X·· 2 天前AI 评分47

ActiveSaddler 动态调整智能体训练场景提升性能

AI 导读

微软等团队提出 ActiveSaddler,通过将反复出现的失败归类为失败模式并作为非平稳 bandit 的 arm,动态调整智能体 harness 的训练场景。该方法追踪各失败模式的学习收益,在复访已知弱点与发现新问题间分配预算,在相同优化器下,GAIA2 Pass@1 提升 4.4 点,Terminal-Bench 2.0 提升 7.5 点。

正文 · AI 翻译

微软与合作者的一篇优秀论文,主题是优化智能体框架(agent harness)。

当前的框架优化器只改变框架的更新方式,却保持训练场景不变,因此反馈始终来自那些随着框架改进而不再具有信息量的任务。

这项工作同时对场景进行自适应调整。

ActiveSaddler 将反复出现的失败归类为失败模式,并将每个模式视为非平稳多臂老虎机中的一个臂。

它跟踪框架从每个模式中还能学到多少,并在重温已知弱点和发现新弱点之间分配预算。

在相同优化器下,与固定场景顺序相比,测试 Pass@1 在 GAIA2 上提升 4.4 分,在 Terminal-Bench 2.0 上提升 7.5 分。

论文:academy.dair.ai/papers/activ…

来源:dair_ai · x.com