Mistral Large 4 发布,Artificial Analysis 智能指数达 38 分
Mistral 发布 Mistral Large 4(Research Public Preview),在 Artificial Analysis Intelligence Index 上得 38 分。
Mistral 发布了 Mistral Large 4,在 Artificial Analysis 智能指数上得分 38;法国重新拥有来自美国和中国之外的最智能模型
@MistralAI 已在 Research Public Preview 中发布 Mistral Large 4,并计划于 10 月底发布该 1T 参数(49B 激活)模型的权重。它在 Artificial Analysis 智能指数上取得 38 分,与 GPT-6 Luna(max,38)和 DeepSeek V4.1 Flash(max,39)相当。它在 Artificial Analysis 网络安全指数上也取得 50%,与 GLM-5.3-Flash 持平,并领先于 Kimi K3 和 DeepSeek V4.1 Flash(max)等模型。
Mistral Large 4 Preview 的关键基准测试结果:
➤ 来自美国和中国之外的最智能模型:Mistral Large 4 Preview 在智能指数上得分 38,与 DeepSeek V4.1 Flash(max,39)和 GPT-6 Luna(max,38)相当。这使其成为来自美国和中国之外的最智能模型,领先于韩国和阿拉伯联合酋长国等国家
➤ 网络防御能力与 GLM-5.3-Flash 持平:Mistral Large 4 Preview 在 Artificial Analysis 网络安全指数上得分 50,与 GLM-5.3-Flash(50)持平,落后于 MiMo-V2.6-Pro(56)。一旦其权重发布,它将在网络安全指数上跻身开放权重模型前三名。其最强结果是在 CyberGym-E2E-AA 上,得分 82%,领先于 MiMo-V2.6-Pro(79%)和 GPT-6 Luna(max,78%)
➤ 每任务成本是同等智能开放权重模型的 4 倍以上:Mistral Large 4 Preview 每个智能指数任务的成本为 $1.13,标准定价为每 1M 输入/输出 token $1.36/$4.18,每 1M 缓存输入 token $0.14。在前两周,Mistral Large 4 Preview 将以 50% 的发布折扣提供服务,使其每任务成本降至 $0.57。这仍然比 GLM-5.3-Flash($0.25)和 DeepSeek V4.1 Flash(max,$0.27)更贵
➤ 强大的文档和图像推理能力:Mistral Large 4 Preview 在 GDP.pdf 上得分 19%,与 MiMo-V2.6-Pro(19%)持平,落后于 Kimi K3(22%)。这比 Mistral Large 3 提高了 18 分,部分得益于其 API 的改进,现在每次请求可接受 100 张图像,而之前的 Mistral 模型只能接受 8 张
关键模型详情:
➤ 上下文窗口:512k tokens
➤ 多模态:文本和图像输入,文本输出
➤ 定价:每 1M 输入/输出 token $1.36/$4.18(每 1M 缓存输入 token $0.14),前两周五折优惠($0.68/$2.09)
➤ 可用性:在 Mistral 的 API 上提供 Research Public Preview,计划于 10 月底开放权重
来源:ArtificialAnlys · x.com