跳到正文
原文
omarsar0· @omarsar0 · X·· 4 小时前AI 评分59

作者呼吁所有智能体基准都应审计其验证器

AI 导读

作者转发了 Parsave 对 Zapier AutomationBench 的审计工作:其检查了全部 600 个公开任务,用逼真的错误答案试图欺骗各验证器,经人工复核确认 206 个真实缺陷,AutomationBench Verified 已修复全部 206 个。

正文 · AI 翻译

我们需要更多这样的努力。

每一个智能体基准测试都应该对其验证器进行审计。

Parsave 逐一检查了 Zapier 的 AutomationBench 中全部 600 个公开任务。

智能体编写了逼真的错误答案,试图欺骗每个验证器,人工复核确认了 206 个真实缺陷。AutomationBench Verified 修复了全部 206 个。

使用修复后的验证器对 1,235 次 Kimi K3 运行重新评分,27.9% 的评分发生了变化。

我刚刚开始研究这个基准测试,用于我正在做的一些独立评估工作,所以看到这份审计报告的时机正好。

来源:omarsar0 · x.com