Anthropic 发布 Claude Haiku 5.5,智能体指数得分 43
Anthropic 发布 Claude Haiku 5.5,在 Artificial Analysis Intelligence Index 上得分 43,比一年前的 Haiku 提升 26 分,是首个支持 effort 设置与 adaptive thinking 的 Haiku 模型。
原文给出了智能体指数、token 消耗和分层定价的对比数据,便于判断它在小模型档位中的性价比位置。
Anthropic 发布了 Claude Haiku 5.5,在 Artificial Analysis 智能指数上得分 43——距离上一代 Haiku 发布一年后提升了 26 分。
Haiku 5.5 是首个支持 Anthropic effort 设置和自适应思考(adaptive thinking)的 Haiku 模型,同时 Anthropic 引入了分层定价。
Haiku 5.5 比前代更便宜——对于 100k token 以内的提示词,输入/输出价格为每 1M token $0.10/$0.50(与 GPT-6 Luna 相同,为上一代 Haiku 模型的 10%)。但超过 100k 后,价格会涨 5 倍至 $0.50/$2.50。网站尚未反映分层定价,因此 Haiku 5.5 的临时成本数据未包含涨价部分。我们正在开发相关支持,很快会跟进 Cost per Task 覆盖。
核心要点:
➤ 小型级别模型的领先表现:在 max effort 下,Haiku 5.5 略领先于 GLM-5.3 Flash(42)、Gemini 3.8 Flash(41)和 GPT-6 Luna(38)等模型。其得分与 Kimi K3(44,一个 2.8T 参数的开放权重模型)相当,比 Claude Sonnet 5.5(max,56)低 13 分。
➤ 相比 GPT-6 Luna 重度使用 token:Haiku 5.5(max)在每项智能指数任务上使用约 162k 输出 token,约为 GPT-6 Luna(max,约 50k)的 3 倍。从 xhigh 提升到 max 可增加 2 分,但 token 消耗约为 1.8 倍。在相近智能水平下,它也比 GPT-6 Luna 用更多 token:Haiku 5.5(high)得 38 分、每任务约 55k token,而 Luna(max)得 38 分、约 50k token,且在更低 effort 设置下差距会拉大。
➤ 在智能体知识工作方面能力很强:在 AA-Briefcase(我们针对真实知识工作任务的私有评估)上,Haiku 5.5(max)达到 1578 Elo,领先于 Kimi K3 和 GLM-5.3 等模型,与 Muse Spark 1.3(max)相当。
➤ 终端使用能力提升:在 Terminal-Bench 4.0 上得分 33%,相比 Haiku 4.5 的 0% 大幅提升。与 GLM-5.3 Flash 持平,领先于 Gemini 3.8 Flash(20%)和 GPT-6 Luna(13%)。
➤ 事实知识较低,但幻觉相对较少:正如小型级别模型的预期,Haiku 5.5 的事实知识低于同门模型。AA-Omniscience 准确率为 36%,而 Gemini 3.8 Flash 为 55%、GPT-6 Luna 为 44%,但这部分是因为它更愿意承认自己不知道——其幻觉率更低,为 40%,而两者分别为 55% 和 77%。
➤ AutomationBench-AA 结果可能被低估:Haiku 5.5 得分 35%,而 GPT-6 Luna、Gemini 3.8 Flash 和 GLM-5.3 Flash 为 53–60%。在预发布测试中,一个安全拒绝问题导致模型过度拒绝。Anthropic 正在解决这个问题——我们会在修复后重新运行该评估,预计分数会上升。
其他模型细节:
➤ 上下文窗口:100 万 token,Claude 4.5 Haiku 为 20 万。
➤ 定价:100k token 以内,输入/输出每 1M token $0.10/$0.50,超过 100k 为 $0.50/$2.50。缓存读取 $0.01(超过 100k 为 $0.05),5 分钟缓存写入 $0.125(超过 100k 为 $0.625)。
➤ 多模态:支持文本和图像输入,文本输出。
来源:ArtificialAnlys · x.com