跳到正文
原文
ArtificialAnlys· @ArtificialAnlys · X·· 7 小时前AI 评分74

Mistral Large 4 发布,Artificial Analysis 智能指数达 38 分

AI 导读

Mistral 发布 Mistral Large 4(Research Public Preview),在 Artificial Analysis Intelligence Index 上得 38 分。

正文 · AI 翻译

Mistral 发布了 Mistral Large 4,在 Artificial Analysis 智能指数上得分 38;法国重新拥有来自美国和中国之外的最智能模型

@MistralAI 已在 Research Public Preview 中发布 Mistral Large 4,并计划于 10 月底发布该 1T 参数(49B 激活)模型的权重。它在 Artificial Analysis 智能指数上取得 38 分,与 GPT-6 Luna(max,38)和 DeepSeek V4.1 Flash(max,39)相当。它在 Artificial Analysis 网络安全指数上也取得 50%,与 GLM-5.3-Flash 持平,并领先于 Kimi K3 和 DeepSeek V4.1 Flash(max)等模型。

Mistral Large 4 Preview 的关键基准测试结果:

➤ 来自美国和中国之外的最智能模型:Mistral Large 4 Preview 在智能指数上得分 38,与 DeepSeek V4.1 Flash(max,39)和 GPT-6 Luna(max,38)相当。这使其成为来自美国和中国之外的最智能模型,领先于韩国和阿拉伯联合酋长国等国家

➤ 网络防御能力与 GLM-5.3-Flash 持平:Mistral Large 4 Preview 在 Artificial Analysis 网络安全指数上得分 50,与 GLM-5.3-Flash(50)持平,落后于 MiMo-V2.6-Pro(56)。一旦其权重发布,它将在网络安全指数上跻身开放权重模型前三名。其最强结果是在 CyberGym-E2E-AA 上,得分 82%,领先于 MiMo-V2.6-Pro(79%)和 GPT-6 Luna(max,78%)

➤ 每任务成本是同等智能开放权重模型的 4 倍以上:Mistral Large 4 Preview 每个智能指数任务的成本为 $1.13,标准定价为每 1M 输入/输出 token $1.36/$4.18,每 1M 缓存输入 token $0.14。在前两周,Mistral Large 4 Preview 将以 50% 的发布折扣提供服务,使其每任务成本降至 $0.57。这仍然比 GLM-5.3-Flash($0.25)和 DeepSeek V4.1 Flash(max,$0.27)更贵

➤ 强大的文档和图像推理能力:Mistral Large 4 Preview 在 GDP.pdf 上得分 19%,与 MiMo-V2.6-Pro(19%)持平,落后于 Kimi K3(22%)。这比 Mistral Large 3 提高了 18 分,部分得益于其 API 的改进,现在每次请求可接受 100 张图像,而之前的 Mistral 模型只能接受 8 张

关键模型详情:

➤ 上下文窗口:512k tokens

➤ 多模态:文本和图像输入,文本输出

➤ 定价:每 1M 输入/输出 token $1.36/$4.18(每 1M 缓存输入 token $0.14),前两周五折优惠($0.68/$2.09)

➤ 可用性:在 Mistral 的 API 上提供 Research Public Preview,计划于 10 月底开放权重

来源:ArtificialAnlys · x.com