Box 测试 Claude Opus 5.5:token 减少 63%、速度提升 30%
Box 测试 Claude Opus 5.5 在企业非结构化数据知识工作任务上的表现,称其达到前沿能力水平,相比 Opus 5 token 用量减少 63%、冗长度降低 42%、速度快 30%,且模型本身更便宜。
在 Box,我们一直在用 Box Agent 在各种复杂的企业知识工作任务上测试 Opus 5.5,这些任务涉及非结构化数据。
总体来看,我们看到了前沿级别的能力,相比 Opus 5 有显著的性能提升:token 用量减少 63%,冗余输出减少 42%,速度比 Opus 5 快 30%。而且模型本身也更便宜,所以对于企业在智能体计算机使用、编程、分析或数据处理方面的任何工作来说,这都是一次重大胜利。
以下是我们跨多个行业测试中取得的任务成效和性能提升的一些例子:
• 金融服务——尽职调查(任务准确率 +39%):一年的交易记录,任务是找出收购目标定价工具中的每一处计算错误。Opus 5.5 在每一次尝试中都取得了满分,用词量只有 Opus 5 的一半,整体 token 消耗减少 82%。
• 科技——云成本分析(任务准确率 +65%):弄清楚一家公司究竟应该在云支出上做出哪些改变。Opus 5.5 选对了留存计算的基准,并且从头到尾都保持了源数据的单位约定一致,所以最终得出的数字是站得住脚的。它只用了 Opus 5 一半的时间,token 用量减少 70%。
• 消费品——客户账户分析(任务准确率 +17%):为客户账户设定入职目标,需要综合阅读已签署的合同、满意度跟踪表和团队指标表。合同从未说明资深/初级的分配比例,于是 Opus 5.5 从 18 人的名册中推导出来,并展示了它所使用的规则;有几位客户在个别调查问题上给出了满分 10 分,因此它对每位客户的回答取了平均值,而不是只取那个单一的 10 分。它用一半的时间完成了这项任务,token 用量减少 78%。
• 临床诊断——数据分析(任务准确率 +15%):疟疾快速检测在旱季和雨季的表现:从两份临床 PDF 中构建患者记录,按季节和性别计算检测阳性率,并检验寄生虫计数在检测阳性和检测阴性患者之间是否真的存在差异。Opus 5.5 发现两组的标准差相差超过 100 倍,于是用正确的方式重新运行了分析,结果发现旱季的差异最终并不成立。这一准确率提升伴随着最终答案只有 Opus 5 的一半长度,端到端的 token 用量也减少了 78%。
客户很快就能在 Box AI Studio 中使用 Opus 5.5 构建 AI 智能体。
来源:levie · x.com