跳到正文
原文
ArtificialAnlys· @ArtificialAnlys · X·· 5 天前AI 评分57

Artificial Analysis 编码智能体指数新增拒绝时机与回退模型视图

AI 导读

Artificial Analysis 为 Coding Agent Index 新增两项安全拒绝报告视图:拒绝时机(任务提示词即触发还是智能体开始工作后触发)与回退模型(拒绝后切换到哪个模型)。

正文 · AI 翻译

Artificial Analysis 编程智能体指数中的安全拒答报告,现已显示拒答发生的时间以及作为回退使用的模型

我们新增了两种探索结果的方式:

➤ 拒答时机:查看拒答是仅由任务提示词触发,还是在智能体已经开始工作之后的任务过程中发生

➤ 回退模型:查看智能体在拒答后切换到了哪个模型,以及哪些尝试被拦截

Claude Code 搭配 Sonnet 5.5 (max) 目前在该指数中排名第一。其安全拒答率为 4.5%,约为 Claude Code 搭配 Opus 5.5 (max) 所记录的 8.9% 的一半。

Sonnet 5.5 约 94% 的拒答发生在第一轮之后。发生拒答后,智能体几乎总是切换到 Opus 4.8。

观察到的回退模式因模型和智能体配置而异。在使用 Fable 5.1 时,Claude Code 主要回退到 Opus 4.8,而在该指数中,Opus 5 占 Devin Fusion 回退的比重要大得多。

这两种视图均适用于整体指数和各项基准测试。安全与回退行为由服务商配置,可能会随时间变化;这些比率反映的是基准测试时记录的行为。

来源:ArtificialAnlys · x.com