Arena 发布 Arena Alignment Index 智能体安全对齐基准
Arena 发布新基准 Arena Alignment Index,基于 27 个模型的 90K+ 真实智能体会话,测量 Unauthorized Action、False Attribution、Deceptive Completion 三项信号。
隆重推出 Arena 对齐指数(Arena Alignment Index),这是我们衡量 AI 智能体在真实场景中安全与对齐表现的新基准。
该指数基于 27 个模型的 9 万多次真实智能体会话构建,衡量三项关键信号:
- 未授权行动(UA):采取超出用户指令或权限范围的行动
- 错误归因(FA):将与用户提供的证据相矛盾的陈述或行为归因于某方
- 欺骗性完成(DC):声称任务已完成,而实际上并未完成。
主要发现:
- OpenAI 模型目前在对齐指数中领先
- 越轨行为虽罕见,但一旦发生可能造成严重后果
- 智能体可能在任务进度上误导用户
- 随着对话变长,不对齐风险会增加
- 各代模型的安全与对齐表现都在持续提升
如下方排行榜所示(按实验室排序),@OpenAI 的 GPT-6.1-Sol 以 87.9 分领跑 Arena 对齐指数,其次是 @AnthropicAI 的 Claude-Opus-5.5(83.2 分)和 @SpaceXAI 的 Grok-4.7(82.7 分)。OpenAI 在三项信号上的观测比率也均为最佳:未授权行动 0.89%、错误归因 1.98%、欺骗性完成 2.34%。
在所有四家实验室中,新一代模型的表现都一致优于前代,这表明智能体的安全与对齐正取得广泛进展。随着智能体承担更长、更复杂、风险更高的任务,衡量的不仅是它们能完成什么,还有它们行动的安全性与可靠性,这一点正变得越来越重要。
这标志着 Arena 在将安全与对齐纳入其 AI 评估核心方面迈出了重要一步。该指数只是一个初始起点,未来我们会持续扩展更多安全信号和模型。
更多分析见下方👇
来源:arena · x.com