跳到正文

全部动态

今日 0 条
10月3日周六
  1. X:Arena (@arena)69

    小米 MiMo-V2.6-Pro 与 MiMo-V2.6-Flash 进入 Agent Arena 榜单

    小米 MiMo-V2.6-Pro 和 MiMo-V2.6-Flash 进入 Agent Arena,Pro 在开源模型中排名第 5,在 8.1K+ 真实智能体会话中净提升 +3.17%,较 MiMo-V2.5-Pro 的第 13 名提升 9 位、提高 10.4 个百分点。

    推荐理由:Agent Arena 的实测排名与成本数据,可用来对比 MiMo-V2.6 两个版本在真实智能体会话中的表现差异。

  2. X:OpenRouter (@OpenRouter)56

    微软 MAI-Voice-2.1 语音模型上线 OpenRouter

    微软 AI 的 MAI-Voice-2.1 已在 OpenRouter 上线,官方称其为 MAI 迄今保真度和表现力最高的文本转语音模型。该模型支持同一音色以 23 种语言说话并保持母语口音,定价为每 100 万字符 22 美元,面向有声书、播客、旁白和品牌音频场景。

  3. X:Arena (@arena)66

    GPT-6.1 Sol 进入 Agent Arena 第 5 名,重塑帕累托前沿

    Arena 宣布 OpenAI 的 GPT-6.1 Sol (Max) 进入 Agent Arena 第 5 名,提升 11.23%,并重塑帕累托前沿。其单任务中位成本为 $0.56,比 GPT-6 Sol 低 39% 且得分高 1.52 分,比 GPT-6 Astra 低 81% 且得分差距 1.04 分。

    推荐理由:Agent Arena 榜单显示 GPT-6.1 Sol 以更低单任务成本进入前五,读者可据此比较它与 GPT-6 Sol、Claude 系列的性价比差距。

  4. X:蚂蚁百灵 (@AntLingAGI)71

    蚂蚁百灵发布 Ling-3.1-flash,约 560B 参数、支持 1M token 上下文并上线 OpenRouter

    蚂蚁百灵发布 Ling-3.1-flash,总参数约 560B、每 token 激活约 25B,支持最高 1M token 上下文,并计划近期开源。该模型已在 OpenRouter 免费上线,官方称其在 GDPVal-AA v2.1 上取得 1,673 Elo、FrontierSWE 75.16、HealthBench Professional 65.35。

    推荐理由:官方给出 Ling-3.1-flash 的参数量、上下文与多项基准成绩,可据此判断其编码与智能体能力定位。

10月2日周五
  1. X:ARC Prize (@arcprize)42

    ARC Prize 回应 Qwen3.8-27B 榜单成本估算方式,ARC-AGI-3 结果待测试完成

    ARC Prize 表示 Qwen3.8-27B 的榜单成本是按阿里云公开 token 价格乘以记录的 token 用量估算,而非其专用推理收费。该模型经 Baseten 测试,使用自带 chat template:low 要求思考简短聚焦,xhigh 要求仔细思考并检查假设,medium 两者都不加。ARC-AGI-3 结果将在测试完成后公布。

  2. X:Arena (@arena)66

    小米 MiMo-V2.6-Pro 与 Flash 登陆 Agent Arena,Pro 位列开源模型第 5

    小米 MiMo-V2.6-Pro 和 MiMo-V2.6-Flash 登陆 Agent Arena,Pro 在 8.1K+ 真实智能体会话中净提升 +3.17%,位列开源模型第 5,较 MiMo-V2.5-Pro 的第 13 名提升 9 位、净提升提高 10.4 个百分点。

    推荐理由:榜单给出了 MiMo-V2.6 两款模型在真实智能体会话中的排名与成本对比,可据此判断开源模型在 Agent 场景的位置。

10月1日周四
  1. Latent Space78

    Google DeepMind 发布 Gemini 4 Argon,支持 1M token 输出

    Google DeepMind 推出 Gemini 4 Argon,面向编码、企业知识工作与网络防御,首批开放给 Fairwind 计划的政府用户与可信网络安全人员,后续再向开发者、企业和消费者开放。

    推荐理由:汇总了 Gemini 4 Argon 的基准、定价与可用范围,并列出同期多家模型与工具的动态,便于横向比较。

  2. X:Arena (@arena)67

    Gemini 4 Argon 与前沿模型对比:单任务成本比 GPT-6.1 Sol 低 33%

    Arena 分享 Google DeepMind 的 Gemini 4 Argon 与多款前沿模型在生成任务上的对比,单任务成本比 GPT-6.1 Sol 低 33%,比 Claude Opus 5.5 低 70%,并附上 @petergostev 的第一印象视频。评论区对评测方式提出质疑,认为用图形设计任务评估文本生成模型意义有限,也有人追问单任务成本是否包含思考 token。

    推荐理由:原文给出 Gemini 4 Argon 与前沿模型的成本对比和实测片段,读者可据此判断其性价比定位。