rohanpaul_ai· @rohanpaul_ai · X·· 3 天前AI 评分
Agent 基准需要审计评分器,而不仅是任务本身
Parsewave 审计了 Zapier AutomationBench 的全部 600 个公开任务(前沿实验室在模型卡中引用该基准),用 Agent 生成看似可信的错误答案,再由人工确认哪些评分器失效,结果有 206 个评分器出错,修复后的 AutomationBench Verified 全部修正了这些问题。
智能体基准测试需要对评分器进行审计,而不仅仅是对任务进行审计。
Parsewave 审查了 Zapier 的 AutomationBench 中全部 600 个公开任务,前沿实验室在其模型卡中引用了该基准。
它使用智能体编写了令人信服的错误答案,然后由人类确认哪些评分器确实失效了:共有 206 个。
AutomationBench Verified 修复了其中每一个。
在 1,235 次 Kimi K3 运行中,修复后的评分器有 27.9% 的情况给出了不同的判定。
最典型的案例是任务 813。评分器检查了 Salesforce 备注,却从未查看 DocuSign 模板。一份使用 Standard 模板发送四份合同(而非要求的 GDPR、HIPAA、SOC2 和 Enterprise 模板)的提交,通过了 13 项检查中的全部 13 项,得分为 1.0。修复后,其得分为 0.09。
来源:rohanpaul_ai · x.com