跳到正文
原文
ArtificialAnlys· @ArtificialAnlys · X·· 21 小时前AI 评分72

Ling 3.1 Flash 智能指数升至 41,Agent 能力显著提升

AI 导读

AntLingAGI 发布推理模型 Ling 3.1 Flash,总参数 560B、激活参数 25B、上下文窗口 1M tokens,在 Artificial Analysis Intelligence Index v4.3 上得分 41,较 8 月发布的 Ling 3.0 Flash 的 20 分大幅提升。

正文 · AI 翻译

Ling 3.1 Flash 在智能水平上较前代产品大幅提升,在 Artificial Analysis 智能指数上得分 41,其中智能体(agentic)能力的提升尤为明显

@AntLingAGI 已发布 Ling 3.1 Flash,这是一款推理模型,总参数量为 560B,激活参数量为 25B,上下文窗口为 1M token。它在 Artificial Analysis 智能指数 v4.3 上得分 41,相比 8 月发布的 Ling 3.0 Flash 的 20 分有所提升。Ling 3.1 Flash 预计将开放权重,蚂蚁集团将很快发布权重。

主要结果:

➤ Ling 3.1 Flash 的智能体能力较前代有所提升。其 GDPval-AA v2 Elo 为 1,622,AA-Briefcase Elo 为 1,400,与 GLM-5.3-Flash、Gemini 3.8 Flash (high) 和 DeepSeek V4.1 Flash (Max) 等同类模型不相上下。Ling 3.1 Flash 在 AutomationBench-AA(62%)和 Terminal-Bench v4.0(33%)上也取得了显著进步。

➤ Ling 3.1 Flash 在 AA-Omniscience 上得分 +2,比 Ling 3.0 Flash(-18)提高了 22 分。与前代相比,其准确率从 18% 上升到 29%,而在尝试率相近(56% 到 58%)的情况下,幻觉率从 44% 降至 38%,这表明其提升主要源于知道得更多,而非更多地选择弃答。作为对比,DeepSeek V4.1 Flash (Max) 的幻觉率为 97%。

➤ Ling 3.1 Flash 是比前代更大的模型,定价相应更高,但 token 效率更优。其总参数量为 560B、激活参数量为 25B,而 Ling 3.0 Flash 分别为 124B 和 5.1B;定价为每 1M 输入/输出 token $0.30 / $0.90,而此前为 $0.075 / $0.22。它运行智能指数测试使用了 218M 输出 token,比 Ling 3.0 Flash(261M)少 16%。

➤ Ling 3.1 Flash 的单任务成本高于部分同类模型,但仍处于最具吸引力的象限。Ling 3.1 Flash 每个任务成本为 $0.99,远高于 GLM-5.3-Flash($0.42)和 DeepSeek V4.1 Flash (Max, $0.32),但低于 Gemini 3.8 Flash (High) 的 $1.24。

更多模型细节:

➤ 规模:总参数量 560B,激活参数 25B

➤ 上下文窗口:1M token

➤ 定价:每 1M 输入 token $0.30,每 1M 输出 token $0.90,缓存输入为每 1M $0.06(8 折优惠)

➤ 可用性:可通过 Novita AI 访问,权重即将发布

来源:ArtificialAnlys · x.com