omarsar0· @omarsar0 · X·· 7 小时前AI 评分
omarsar0:Agent 基准都应审计其验证器
omarsar0 表示每个 Agent 基准都应该审计其验证器。他提到 Parsewave 审计了 Zapier 的 AutomationBench 全部 600 个公开任务,让 Agent 编写逼真的错误答案试图欺骗每个验证器,经人工复核确认存在 206 个真实 bug,AutomationBench Verified 已修复全部 206 个。
我们需要更多这样的努力。
每个智能体基准测试都应该对其验证器进行审计。
Parsewave 对 Zapier 的 AutomationBench 中全部 600 个公开任务进行了审查。
智能体编写了逼真的错误答案,试图欺骗每个验证器,人工复核确认了 206 个真实缺陷。AutomationBench Verified 修复了全部 206 个。
针对 1,235 次 Kimi K3 运行,修复后的验证器改变了 27.9% 的评分。
我刚刚开始研究这个基准测试,用于我正在进行的一些独立评估工作,所以看到这次审计的时机正好。
来源:omarsar0 · x.com