Databricks 测评:Opus 5.5 与 GPT-6 Luna 明显推进成本质量前沿
Databricks 的 pwendell 发布基于 N=2,400 名工程师在线负载分析与离线评测的结果,认为上周发布的三款模型中有两款明显扩展成本质量前沿:Opus 5.5 和 GPT-6 Luna。
模型发布迎来疯狂的几周!我们在 @Databricks 的研究发现,几款新模型在帕累托前沿上实现了显著推进。以下是结果(针对 2,400 名工程师的在线工作负载分析,以及离线评估):
1. 上周发布的三款模型中,有两款明显拓展了成本/质量前沿:Opus 5.5 和 GPT-6 Luna。
2. Opus 5.5 目前是质量最高的中档模型。它优于此前所有的 Opus 模型,也优于 GPT-6 Sol 和 GPT-5.6 Sol。
3. 在离线和在线分析中,Opus 5.5 在相同任务上的成本均稳定降低 20%。这是以 Opus 4.8 为基准得出的,它是此前成本最低的 Opus 模型(Opus 5.0 有点令人失望,成本高但质量提升几乎察觉不到)。
4. 得益于一流的品质和更低的成本,Opus 5.5 是编程场景下“日常默认”模型的有力候选,我们目前在 Databricks 正是出于这一目的在推荐它。
5. GPT-6 Luna 非常、非常、非常便宜。在我们测试的每一项离线基准和观察到的在线使用中,其单任务成本都至少比 Opus 5.5 低 20 倍。
6. 考虑到它的价格,GPT-6 Luna 的能力令人惊讶。在我们最困难的评估套件之一上,它的表现大致与 Opus 4.6 相当,而单任务成本比当时的 Opus 4.6 低 99.3%。9 个月里成本降低了 100 倍!这一发现是初步的,我们仍在通过更广泛的离线和在线测试评估 Luna 的质量。
我们的生产环境配置:使用 Unity Gateway 在各模型间路由工作负载并追踪智能体交互。终端用户工具链包括:Omingent(元工具链)、Claude Code、Codex 和 Cursor。
来源:pwendell · x.com