评测来源官方评测
Creative Writing v3
EQ-Bench · 短篇创作与表达
在 灵耀AI热点 中
证据预算3.6%
上游数据时间09/24 15:57
最近成功同步10/03 14:10
它测什么,怎么测
官方 CSV 内嵌于数据脚本,采用 Elo;Sonnet 4.6 判胜负,风格、重复率和 rubric 不重复计票。
如何使用这份证据
正式计分;两张写作榜合计占 6%,不按题数或模型数增加权重。
评测成绩
| 原榜名次 | 原榜型号 | 原始成绩 | 代表配置 |
|---|---|---|---|
| 1 | gpt-6-astraOpenAI | 2,173.3 | 来源默认配置 |
| 2 | claude-fable-5-1Anthropic | 2,162 | 来源默认配置 |
| 3 | claude-opus-5Anthropic | 2,132.6 | 来源默认配置 |
| 4 | gpt-6-solOpenAI | 2,124.7 | 来源默认配置 |
| 5 | kimi-k3Moonshot AI | 2,082.3 | 来源默认配置 |
| 6 | GLM-5.3Z.ai | 2,075 | 来源默认配置 |
| 7 | claude-opus-5-5Anthropic | 2,050.1 | 来源默认配置 |
| 8 | grok-4.7xAI | 2,006.7 | 来源默认配置 |
| 10 | gpt-5.6-solOpenAI | 1,971.6 | 来源默认配置 |
| 11 | claude-fable-5Anthropic | 1,943.1 | 来源默认配置 |
| 12 | aion-labs | 1,929.3 | 来源默认配置 |
| 13 | muse-spark-1.1Meta | 1,927.1 | 来源默认配置 |
| 14 | claude-opus-4-7Anthropic | 1,914.3 | 来源默认配置 |
| 15 | — | 1,906.4 | 来源默认配置 |
| 16 | muse-spark-1.3Meta | 1,905.9 | 来源默认配置 |
| 17 | gpt-5.6-terraOpenAI | 1,854.9 | 来源默认配置 |
| 18 | gpt-5.5OpenAI | 1,843.9 | 来源默认配置 |
| 19 | Alibaba | 1,842.5 | 来源默认配置 |
| 20 | muse-spark-1.2Meta | 1,840.4 | 来源默认配置 |
| 21 | claude-opus-4-8Anthropic | 1,839.8 | 来源默认配置 |
| 22 | gpt-5.4OpenAI | 1,839.7 | 来源默认配置 |
| 23 | gpt-5.6-lunaOpenAI | 1,828.7 | 来源默认配置 |
| 24 | claude-sonnet-4-6Anthropic | 1,810.4 | 来源默认配置 |
| 25 | claude-opus-4-6Anthropic | 1,809.1 | 来源默认配置 |
| 26 | Meta | 1,798.3 | 来源默认配置 |
| 27 | claude-sonnet-5Anthropic | 1,794 | 来源默认配置 |
| 28 | stealth | 1,784.3 | 来源默认配置 |
| 29 | zai-org/GLM-5.2Z.ai | 1,756.5 | 来源默认配置 |
| 30 | gemini-3.8-flashGoogle | 1,747.9 | 来源默认配置 |
| 31 | moonshotai/Kimi-K2.6Moonshot AI | 1,724.5 | 来源默认配置 |
评测局限与数据署名
以英文写作为主,依赖模型裁判;同一裁判和相关任务共用预算,不代表中文文笔。
数据许可:MIT · EQ-bench-site README 元数据声明
成绩由 EQ-Bench 发布,原始分数与 灵耀AI热点 共识分使用不同尺度,不能直接相加。