跳到正文
10月3日 · 周六

最新精选

今天10月3日周六
  1. X:Arena (@arena)66

    Claude Sonnet 5.5 在 Agent Arena 排名第 3,Code Arena 第 3

    Arena 公布 Claude Sonnet 5.5 (Max) 在 Agent Arena 首次上榜即排名第 3,净提升 +12.5%,比排名第 13 的 Claude Sonnet 5 (High) 高出 8.1 个百分点。

    推荐理由:榜单给出了 Claude Sonnet 5.5 在 Agent Arena 与 Code Arena 的排名、分数和每任务成本,可据此比较它与 Opus 5.5、GPT-6 Astra 的性价比。

  2. X:OpenRouter (@OpenRouter)71

    Black Forest Labs 的 FLUX 3 Image 上线 OpenRouter

    Black Forest Labs 的新旗舰图像模型 FLUX 3 Image 已在 OpenRouter 上线,支持文生图和多参考图编辑,原生渲染最高 4K。

    推荐理由:FLUX 3 Image 在 OpenRouter 上线,给出了多参考图编辑、4K 生成与按分辨率计费的具体信息。

  3. X:Arena (@arena)66

    GPT-6.1 Sol 进入 Agent Arena 第 5 名,重塑帕累托前沿

    Arena 宣布 OpenAI 的 GPT-6.1 Sol (Max) 进入 Agent Arena 第 5 名,提升 11.23%,并重塑帕累托前沿。其单任务中位成本为 $0.56,比 GPT-6 Sol 低 39% 且得分高 1.52 分,比 GPT-6 Astra 低 81% 且得分差距 1.04 分。

    推荐理由:Agent Arena 榜单显示 GPT-6.1 Sol 以更低单任务成本进入前五,读者可据此比较它与 GPT-6 Sol、Claude 系列的性价比差距。

10月2日周五
  1. X:Arena (@arena)69

    小米 MiMo-V2.6-Pro 与 MiMo-V2.6-Flash 进入 Agent Arena 榜单

    小米 MiMo-V2.6-Pro 和 MiMo-V2.6-Flash 进入 Agent Arena,Pro 在开源模型中排名第 5,在 8.1K+ 真实智能体会话中净提升 +3.17%,较 MiMo-V2.5-Pro 的第 13 名提升 9 位、提高 10.4 个百分点。

    推荐理由:Agent Arena 的实测排名与成本数据,可用来对比 MiMo-V2.6 两个版本在真实智能体会话中的表现差异。

10月1日周四
  1. X:Google DeepMind (@GoogleDeepMind)66

    Google DeepMind 发布 SynthID Bio,可在蛋白质序列中嵌入水印

    Google DeepMind 发布 SynthID Bio,这是一组面向 AI 生成生物设计的水印方法,可在不影响生物功能的前提下把不可感知的签名直接嵌入蛋白质序列。该水印类似数字身份证,可帮助 DNA 实验室验证合成蛋白质并保持序列数据库准确,相关工具以开放形式供研究使用。

    推荐理由:原文给出 SynthID Bio 的嵌入方式与开放研究入口,读者可据此了解 AI 生物设计溯源的具体做法。

  2. Latent Space78

    Google DeepMind 发布 Gemini 4 Argon,支持 1M token 输出

    Google DeepMind 推出 Gemini 4 Argon,面向编码、企业知识工作与网络防御,首批开放给 Fairwind 计划的政府用户与可信网络安全人员,后续再向开发者、企业和消费者开放。

    推荐理由:汇总了 Gemini 4 Argon 的基准、定价与可用范围,并列出同期多家模型与工具的动态,便于横向比较。

  3. X:Arena (@arena)67

    Gemini 4 Argon 与前沿模型对比:单任务成本比 GPT-6.1 Sol 低 33%

    Arena 分享 Google DeepMind 的 Gemini 4 Argon 与多款前沿模型在生成任务上的对比,单任务成本比 GPT-6.1 Sol 低 33%,比 Claude Opus 5.5 低 70%,并附上 @petergostev 的第一印象视频。评论区对评测方式提出质疑,认为用图形设计任务评估文本生成模型意义有限,也有人追问单任务成本是否包含思考 token。

    推荐理由:原文给出 Gemini 4 Argon 与前沿模型的成本对比和实测片段,读者可据此判断其性价比定位。

  4. X:Arena (@arena)78

    Arena 评测:Gemini 4 Argon (High) 登顶 Text Arena,Agent Arena 排第 8

    Arena 公布 Google DeepMind 的 Gemini 4 Argon (High) 在 Text Arena 以 1525 分排名第 1,在 Code Arena: WebDev 以 1679 分排名第 8,在 Agent Arena 以 +7.92% 净提升排名第 8,每任务成本 0.62 美元。

    推荐理由:Arena 公布了 Gemini 4 Argon (High) 在 Agent Arena 与 Text Arena 的排名和成本数据,可据此比较其与 Gemini 3.8 Flash、Claude Opus 4.6 的差距。

  5. X:Arena (@arena)82

    Gemini 4 Argon (High) 登顶 Text Arena,Code Arena WebDev 升至第 8

    Google DeepMind 的 Gemini 4 Argon (High) 以 1525 分登上 Text Arena 第 1,并在 Code Arena: WebDev 以 1679 分位列第 8。

    推荐理由:读者可据此了解 Gemini 4 Argon 在 Text Arena 与 Code Arena 的排名变化,以及其混合价格下的性价比位置。

  6. X:Logan Kilpatrick (@OfficialLoganK)80

    Google 发布 Gemini 4 Argon 前沿模型,率先面向网络安全防御者开放

    Google 发布新前沿模型 Gemini 4 Argon,今天起率先向网络安全防御者推送,之后将尽快扩大开放范围。该模型在介绍期定价为输入 $2、输出 $10。

    推荐理由:Google 员工公布 Gemini 4 Argon 的发布节奏与定价,可据此了解新前沿模型的开放路径和成本。

  7. Google DeepMind78

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御者开放,随后将逐步面向开发者、企业和消费者推出,起步价为每百万输入 token 2 美元、每百万输出 token 10 美元。

    推荐理由:Gemini 4 Argon 的 1M 输出 token 与多项基准成绩,展示了长程复杂任务上的能力边界变化。

9月30日周三
  1. Google DeepMind71

    Google DeepMind 推出 SynthID Bio,为 AI 生成蛋白质嵌入可验证水印

    Google DeepMind 推出 SynthID Bio,将水印技术引入合成生物学,把不可感知的签名直接嵌入生物代码,使其在数字模型和合成出的实体蛋白质上均可验证,同时保持生物功能。

    推荐理由:原文给出了水印嵌入方式与湿实验验证结果,读者可据此判断AI生成生物设计的溯源路径。

  2. X:OpenAI (@OpenAI)86

    OpenAI 发布 GPT-6.1 Sol,面向 ChatGPT Work 和 Codex 用户开放

    OpenAI 发布 GPT-6.1 Sol,今日起向 ChatGPT Work 和 Codex 的 Plus、Pro、Business、Enterprise 和 Edu 用户开放。

    推荐理由:原文给出 GPT-6.1 Sol 的定价与缓存输入成本,读者可据此比较它与 GPT-6 Sol、GPT-6 Astra 的性价比。

  3. X:OpenAI (@OpenAI)82

    OpenAI 发布 GPT-6.1 Sol,缓存输入每百万 token 0.10 美元

    OpenAI 发布 GPT-6.1 Sol,称其以 GPT-6 Astra 五分之一的成本提供接近 Astra 的智能水平,是当前同性能下最具成本效率的模型。缓存输入价格为每百万 token 0.10 美元,比标准输入价格低 95%,比 GPT-6 Sol 的缓存输入价格低 50%。

    推荐理由:OpenAI 官方给出 GPT-6.1 Sol 的定价与缓存折扣,并说明它在编码、computer use 与对齐评测上的位置,便于判断成本与能力取舍。

9月29日周二
  1. Hugging Face Blog62

    NVIDIA 发布 Kumo Tabular 表格基础模型,在四个基准排名第一

    NVIDIA 发布开源表格基础模型 Kumo Tabular,给定带标签的表格行即可在单次前向传播中预测新行标签,无需训练、调参和特征工程,同时支持分类与回归。

    推荐理由:原文给出模型规模、训练数据来源与四个基准排名,可据此判断表格基础模型相对梯度提升树路线的差异。

  2. Simon Willison78

    Anthropic 发布 Claude Sonnet 5.5,速度提升 30% 以上

    Anthropic 发布新 Sonnet 模型 Claude Sonnet 5.5,官方称其运行速度快 30% 以上,多数工作成本最多降低 30%,定价与 Sonnet 5 相同但在各项基准上均优于后者。

    推荐理由:作者实测了 Sonnet 5.5 的思考预算与免费层表现,可据此了解它在编码任务上的定位与成本取舍。

  3. X:Cognition (@cognition)66

    Devin Desktop 与 Devin CLI 上线 Claude Sonnet 5.5

    Claude Sonnet 5.5 现已在 Devin Desktop 和 Devin CLI 中可用,在 FrontierCode 1.1 Main 上得分 64.4%,高于 Sonnet 5 的 56.2%,并超过 Fable 5.1 的 extra high reasoning effort 表现。

    推荐理由:Devin 上线 Claude Sonnet 5.5,并给出 FrontierCode 1.1 分数与成本变化,可据此判断编码智能体的性价比。

  4. X:Cognition (@cognition)65

    Claude Sonnet 5.5 上线 Devin Desktop 与 Devin CLI

    Cognition 宣布 Claude Sonnet 5.5 已在 Devin Desktop 和 Devin CLI 中可用,在 FrontierCode 1.1 Main 上得分 64.4%,高于 Sonnet 5 的 56.2%,并在 extra high reasoning effort 下超过 Fable 5.1。

    推荐理由:Devin 上线 Claude Sonnet 5.5 并给出 FrontierCode 1.1 分数与 Sonnet 5 的对比,可据此判断编码智能体的模型选择。

9月28日周一
  1. Hugging Face Blog72

    H公司发布 Holo4 系列智能体模型,含 27B 与 35B-A3B 两个版本

    H公司发布 Holo4 系列智能体模型,包含 27B dense 与 35B-A3B Mixture of Experts 两个版本,均已上线 H Models API,权重以 BF16、FP8、NVFP4 和 4-bit GGUF 形式开源在 Hugging Face,同时发布 Holotron4 Nano。

    推荐理由:Holo4 同时覆盖 GUI、代码、MCP 与 API 四种接口,并公开全部评测轨迹,可据此判断通用计算机操作智能体的路线取舍。

9月25日周五
  1. X:美团 LongCat (@Meituan_LongCat)70

    美团 LongCat-2.5-Preview 上线:1.6T 参数、1M token 上下文、原生多模态

    美团 LongCat 宣布 LongCat-2.5-Preview 上线,总参数量 1.6T、激活约 48B,支持 1M token 上下文窗口,原生多模态。官方称该模型面向长周期任务,覆盖终端、浏览器、GUI、表格和设计工具等场景,现已开放 API(longcat.ai/platform/)和 Chat(longcat.ai/chat/)入口。

    推荐理由:官方给出参数量、激活规模与 1M 上下文等关键规格,可据此判断它在长任务场景的定位。