Claude Sonnet 5.5 以 xHigh 推理进入 Code Arena WebDev 榜单第 3
Claude Sonnet 5.5 以 xHigh 推理模式进入 Code Arena: WebDev,得分 1786 分排名第 3,混合价格 $8/M tokens。
Claude Sonnet 5.5 以 xHigh 推理模式进入 Code Arena: WebDev,得分 1786 分排名第 3,混合价格 $8/M tokens。
小米 MiMo-V2.6-Pro 和 MiMo-V2.6-Flash 进入 Agent Arena,Pro 在开源模型中排名第 5,在 8.1K+ 真实智能体会话中净提升 +3.17%,较 MiMo-V2.5-Pro 的第 13 名提升 9 位、提高 10.4 个百分点。
推荐理由:Agent Arena 的实测排名与成本数据,可用来对比 MiMo-V2.6 两个版本在真实智能体会话中的表现差异。
Arena 发布本周榜单更新,四款新模型改变了 Text、Code 和 Agent Arena 的帕累托前沿。
Arena 公布 Claude Sonnet 5.5(Max)首次进入 Agent Arena 即排名第 3,净提升 +12.5%,比排名第 13 的 Claude Sonnet 5(High,+4.4%)高出 8.1 个百分点;在 Chat 分类中以 +15.6% 位列第 1,高于 Fable 5.1(+11.49%)和 Opus 5.5(+10.29%)。
Arena 公布 Claude Sonnet 5.5 (Max) 在 Agent Arena 首次上榜即排名第 3,净提升 +12.5%,比排名第 13 的 Claude Sonnet 5 (High) 高出 8.1 个百分点。
推荐理由:榜单给出了 Claude Sonnet 5.5 在 Agent Arena 与 Code Arena 的排名、分数和每任务成本,可据此比较它与 Opus 5.5、GPT-6 Astra 的性价比。
Anthropic 的 Claude Sonnet 5.5(Max)在 Agent Arena 首次上榜即位列第 3,净提升 +12.5%,比排名第 13 的 Claude Sonnet 5(High,+4.4%)高出 8.1 个百分点。
Tavus 发布 Griffin,称其为首个通过视频图灵测试的模型,48% 的实时对话者认为它是真人,而此前系统的通过率低于 3%。该模型在 NVIDIA 的全双工 AI 视频基准上排名第一,并被称作首个 Human Interaction Model(HIM)。
xAI 的 Grok Imagine Video 1.5 Lite 已在 fal 上线,这是 Grok Imagine 视频家族中的轻量级模型,支持文生视频和图生视频并带原生音频。该模型可生成 1 至 15 秒、480p/720p/1080p 分辨率的视频,覆盖从 16:9 到 9:16 的 7 种宽高比。
Grok Imagine Video 1.5 Lite 已在 fal 上线,是 Grok Imagine 视频家族中的轻量级模型。它支持文生视频与图生视频,可生成 1 至 15 秒、带原生音频的视频,输出 480p、720p 和 1080p,覆盖从 16:9 到 9:16 的 7 种宽高比。
微软 AI 的 MAI-Voice-2.1-Flash 已在 OpenRouter 上线,这是一款面向实时响应的低延迟文本转语音模型。官方称其可在 150ms 内生成 45 秒音频,同一音色可用 23 种语言说话并保持母语口音,定价为每 100 万字符 15 美元,面向语音智能体、助手和呼叫中心等实时场景。
微软 AI 的 MAI-Voice-2.1 已在 OpenRouter 上线,官方称其为 MAI 迄今保真度和表现力最高的文本转语音模型。该模型支持同一音色以 23 种语言说话并保持母语口音,定价为每 100 万字符 22 美元,面向有声书、播客、旁白和品牌音频场景。
Black Forest Labs 的新旗舰图像模型 FLUX 3 Image 已在 OpenRouter 上线,支持文生图与多参考图编辑,原生渲染最高 4K。
推荐理由:FLUX 3 Image 在 OpenRouter 上线,给出多参考图编辑、4K 输出与按分辨率计费的具体价格,可据此评估图像生成成本。
Black Forest Labs 的新旗舰图像模型 FLUX 3 Image 已在 OpenRouter 上线,支持文生图和多参考图编辑,原生渲染最高 4K。
推荐理由:FLUX 3 Image 在 OpenRouter 上线,给出了多参考图编辑、4K 生成与按分辨率计费的具体信息。
Tavus 预览了其最新模型 Griffin,一款能看、能听、能发声并像人一样呈现的 Human Interaction Model,目前尚未公开可用,此次仅为有限的研究预览。
Ideogram 4.5 在 Artificial Analysis 的 AA-Image-Editing v2.0 榜单上位列第 23,是 Ideogram 首个进入该编辑榜的模型,同时在 AA-Image-T2I v2.0 上排名第 34,较 Ideogram 4.0 的第 40 名有所上升。
Ideogram 4.5 于 9 月 30 日发布,在 AA-Image-Editing v2.0 排名第 23(Ideogram 首个上榜的编辑模型),在 AA-Image-T2I v2.0 排名第 34,较 Ideogram 4.0 的第 40 名上升。
Ideogram 4.5 于 9 月 30 日发布,在 Artificial Analysis 的 AA-Image-Editing v2.0 榜单上排名第 23,是 Ideogram 首个登上该图像编辑榜的模型,在 AA-Image-T2I v2.0 上从 Ideogram 4.0 的第 40 名升至第 34 名。
Viggle AI 9 月在 HuggingFace 发布 3 个开放权重模型,其中 Viggle-Animate 与 Meridian 获评 Space of the Week。Qwen-Image-2.1-viggle-turbo 位列 trending Space 第 4、trending model 第 9,获 900+ likes、260K+ 下载量,并衍生 50+ 社区 Space。
微软在 Hugging Face 发布 4B 模型 FrogNano-4B-2609,基于 Qwen3.5-4B 用 TaskPilot 合成任务纯 RL 后训练,仅 5 轮迭代、每轮 300 个任务,零蒸馏。该模型在 SWE-bench Verified 上取得 61.5%。
Perplexity 近期开源了多项成果,包括 pplx-decider-v1-27b 多模态决策模型,在 11 项基准上平均得分 85.7%,领先 Jev;pplx-embed-v2-context-9b-preview 上下文嵌入模型在 ConTEB 和 turbopuffer context-bench 上表现最佳。
Google 回顾 9 月 AI 更新,推出最新前沿模型 Gemini 4 Argon,具备高级推理能力和 100 万 token 输出上限,主打网络安全防御等复杂任务。
Arena 宣布 OpenAI 的 GPT-6.1 Sol (Max) 进入 Agent Arena 第 5 名,提升 11.23%,并重塑帕累托前沿。其单任务中位成本为 $0.56,比 GPT-6 Sol 低 39% 且得分高 1.52 分,比 GPT-6 Astra 低 81% 且得分差距 1.04 分。
推荐理由:Agent Arena 榜单显示 GPT-6.1 Sol 以更低单任务成本进入前五,读者可据此比较它与 GPT-6 Sol、Claude 系列的性价比差距。
Cloudflare 发布 Clef 和 Clef-flash 两款面向 AI 智能体的决策模型,返回带概率的简短分类而非长文本,用于路由工单、触发升级或转交人工。
Gemini 9 月发布回顾涵盖多项更新:Gemini 4 Argon 作为最新前沿模型,具备高级推理能力和 100 万 token 输出上限,主打网络安全防御等复杂任务。
蚂蚁百灵发布 Ling-3.1-flash,总参数约 560B、每 token 激活约 25B,支持最高 1M token 上下文,并计划近期开源。该模型已在 OpenRouter 免费上线,官方称其在 GDPVal-AA v2.1 上取得 1,673 Elo、FrontierSWE 75.16、HealthBench Professional 65.35。
推荐理由:官方给出 Ling-3.1-flash 的参数量、上下文与多项基准成绩,可据此判断其编码与智能体能力定位。
Ai2 开源 AstaBrief 8B,一个把研究问题和检索到的文献片段转成带引用报告的模型,基于 Qwen3-8B 经 SFT 和 DPO 训练,权重与训练数据一并开放。
微软 AI 发布实时转录模型 MAI-Transcribe-2-Streaming,支持 60 种语言,首个部分结果延迟约 100 毫秒,微软称其在 Artificial Analysis 准确率排名第一,年底前音频价格为每小时 0.54 美元。
Black Forest Labs 发布 Flux 3 模型家族中的图像模型 Flux 3 Image,官方称其支持多步编辑而不改动图像其他部分,覆盖文生图、图生图、文字渲染和照片级真实感。
小米 MiMo V2.6 Pro 进入 Arena 智能体排行榜第 19 名,输出价格为每百万 token 0.87 美元,低于排在其前面的全部 18 个模型。其单任务中位成本为 0.10 美元,与榜单前 19 名中的最低值持平,排名第 15 的 DeepSeek V4.1 Flash (Max) 与之相同。
Griffin 发布,被称为首个通过视频图灵测试的模型,48% 与其实时对话的人认为它是真人,此前系统的通过率低于 3%。它还在 NVIDIA 的全双工 AI 视频基准上排名第一,被称为首个 Human Interaction Model(HIM)。
ARC Prize 表示 Qwen3.8-27B 的榜单成本是按阿里云公开 token 价格乘以记录的 token 用量估算,而非其专用推理收费。该模型经 Baseten 测试,使用自带 chat template:low 要求思考简短聚焦,xhigh 要求仔细思考并检查假设,medium 两者都不加。ARC-AGI-3 结果将在测试完成后公布。
ARC Prize 公布 Qwen3.8-27B 在 ARC-AGI(Verified)上的测试结果:ARC-AGI v2 得分 42.4%、每任务 0.45 美元,ARC-AGI v1 得分 87.5%、每任务 0.22 美元。
小米 MiMo-V2.6-Pro 和 MiMo-V2.6-Flash 登陆 Agent Arena,Pro 在 8.1K+ 真实智能体会话中净提升 +3.17%,位列开源模型第 5,较 MiMo-V2.5-Pro 的第 13 名提升 9 位、净提升提高 10.4 个百分点。
推荐理由:榜单给出了 MiMo-V2.6 两款模型在真实智能体会话中的排名与成本对比,可据此判断开源模型在 Agent 场景的位置。
商汤发布由 SenseNova 6.8 Flash Preview 驱动的 Dynamic Design,可将静态图像转化为动态内容。该功能以预览版形式亮相,官方演示展示了黄果树瀑布、青海门源等静态图片的动态化效果。
Google DeepMind 发布 SynthID Bio,这是一套面向 AI 生成生物设计的水印方法。该团队称可在蛋白质序列中直接嵌入不易察觉的签名,且不影响其生物功能。
Google DeepMind 推出 Gemini 4 Argon,面向编码、企业知识工作与网络防御,首批开放给 Fairwind 计划的政府用户与可信网络安全人员,后续再向开发者、企业和消费者开放。
推荐理由:汇总了 Gemini 4 Argon 的基准、定价与可用范围,并列出同期多家模型与工具的动态,便于横向比较。
Perplexity 发布上下文嵌入模型 pplx-embed-v2-context-9b-preview,该模型在 ConTEB 和 turbopuffer 的 context-bench 上取得新的 SOTA。
OpenAI 的 Tibo 表示,GPT-6.1 Sol 在 API 和订阅两端的需求量几乎是历来最高的,ChatGPT 与 Codex 中负载很重。团队已上线更多算力,未来数小时速度应会明显改善,接近昨天服务速度的两倍。
Arena 分享 Google DeepMind 的 Gemini 4 Argon 与多款前沿模型在生成任务上的对比,单任务成本比 GPT-6.1 Sol 低 33%,比 Claude Opus 5.5 低 70%,并附上 @petergostev 的第一印象视频。评论区对评测方式提出质疑,认为用图形设计任务评估文本生成模型意义有限,也有人追问单任务成本是否包含思考 token。
推荐理由:原文给出 Gemini 4 Argon 与前沿模型的成本对比和实测片段,读者可据此判断其性价比定位。
DFlash 草稿模型现已上线,适用于 Ornith-1.5 9B、35B-A3B 和 397B。DFlash 作为草稿模型一次起草多个 token,再由 Ornith 1.5 单次并行验证,取代逐 token 生成。性能评测显示 DFlash 最高实现 2.54× 加速,且生成质量无损失。