跳到正文
原文
ArtificialAnlys· @ArtificialAnlys · X·· 12 小时前精选AI 评分76

Anthropic 发布 Claude Haiku 5.5,智能体指数得分 43

AI 导读

Anthropic 发布 Claude Haiku 5.5,在 Artificial Analysis Intelligence Index 上得分 43,比一年前的 Haiku 提升 26 分,是首个支持 effort 设置与 adaptive thinking 的 Haiku 模型。

推荐理由

原文给出了智能体指数、token 消耗和分层定价的对比数据,便于判断它在小模型档位中的性价比位置。

正文 · AI 翻译

Anthropic 发布了 Claude Haiku 5.5,在 Artificial Analysis 智能指数上得分 43——距离上一代 Haiku 发布一年后提升了 26 分。

Haiku 5.5 是首个支持 Anthropic effort 设置和自适应思考(adaptive thinking)的 Haiku 模型,同时 Anthropic 引入了分层定价。

Haiku 5.5 比前代更便宜——对于 100k token 以内的提示词,输入/输出价格为每 1M token $0.10/$0.50(与 GPT-6 Luna 相同,为上一代 Haiku 模型的 10%)。但超过 100k 后,价格会涨 5 倍至 $0.50/$2.50。网站尚未反映分层定价,因此 Haiku 5.5 的临时成本数据未包含涨价部分。我们正在开发相关支持,很快会跟进 Cost per Task 覆盖。

核心要点:

➤ 小型级别模型的领先表现:在 max effort 下,Haiku 5.5 略领先于 GLM-5.3 Flash(42)、Gemini 3.8 Flash(41)和 GPT-6 Luna(38)等模型。其得分与 Kimi K3(44,一个 2.8T 参数的开放权重模型)相当,比 Claude Sonnet 5.5(max,56)低 13 分。

➤ 相比 GPT-6 Luna 重度使用 token:Haiku 5.5(max)在每项智能指数任务上使用约 162k 输出 token,约为 GPT-6 Luna(max,约 50k)的 3 倍。从 xhigh 提升到 max 可增加 2 分,但 token 消耗约为 1.8 倍。在相近智能水平下,它也比 GPT-6 Luna 用更多 token:Haiku 5.5(high)得 38 分、每任务约 55k token,而 Luna(max)得 38 分、约 50k token,且在更低 effort 设置下差距会拉大。

➤ 在智能体知识工作方面能力很强:在 AA-Briefcase(我们针对真实知识工作任务的私有评估)上,Haiku 5.5(max)达到 1578 Elo,领先于 Kimi K3 和 GLM-5.3 等模型,与 Muse Spark 1.3(max)相当。

➤ 终端使用能力提升:在 Terminal-Bench 4.0 上得分 33%,相比 Haiku 4.5 的 0% 大幅提升。与 GLM-5.3 Flash 持平,领先于 Gemini 3.8 Flash(20%)和 GPT-6 Luna(13%)。

➤ 事实知识较低,但幻觉相对较少:正如小型级别模型的预期,Haiku 5.5 的事实知识低于同门模型。AA-Omniscience 准确率为 36%,而 Gemini 3.8 Flash 为 55%、GPT-6 Luna 为 44%,但这部分是因为它更愿意承认自己不知道——其幻觉率更低,为 40%,而两者分别为 55% 和 77%。

➤ AutomationBench-AA 结果可能被低估:Haiku 5.5 得分 35%,而 GPT-6 Luna、Gemini 3.8 Flash 和 GLM-5.3 Flash 为 53–60%。在预发布测试中,一个安全拒绝问题导致模型过度拒绝。Anthropic 正在解决这个问题——我们会在修复后重新运行该评估,预计分数会上升。

其他模型细节:

➤ 上下文窗口:100 万 token,Claude 4.5 Haiku 为 20 万。

➤ 定价:100k token 以内,输入/输出每 1M token $0.10/$0.50,超过 100k 为 $0.50/$2.50。缓存读取 $0.01(超过 100k 为 $0.05),5 分钟缓存写入 $0.125(超过 100k 为 $0.625)。

➤ 多模态:支持文本和图像输入,文本输出。

来源:ArtificialAnlys · x.com