跳到正文

#推理

今日 5 条
10月3日周六
10月2日周五
  1. MIT Technology Review · AI38

    别被迷惑——LLM 并不会推理

    前 Google DeepMind 研究员指出,LLM 靠逐个预测 token 生成答案,其思维链仍由同一套下一 token 预测产生,并非 AlphaGo 那种独立搜索机制,因此不构成真正的推理。他列举三大缺陷:模型没有显式可检查的认知状态、知识与推理在权重中纠缠不清、思维链常是事后编造。为此他离开 Google DeepMind,主张借鉴 AlphaGo 架构,让系统维护可更新的认知状态。

10月1日周四
  1. Latent Space78

    Google DeepMind 发布 Gemini 4 Argon,支持 1M token 输出

    Google DeepMind 推出 Gemini 4 Argon,面向编码、企业知识工作与网络防御,首批开放给 Fairwind 计划的政府用户与可信网络安全人员,后续再向开发者、企业和消费者开放。

    推荐理由:汇总了 Gemini 4 Argon 的基准、定价与可用范围,并列出同期多家模型与工具的动态,便于横向比较。

  2. GoogleAI74

    Google 官方宣布推出新前沿模型 Gemini 4 Argon,面向复杂、长周期工作流的持续深度推理,在真实软件工程、法律与金融等企业知识工作以及网络安全防御场景提供前沿性能。同时,该模型的输出 token 上限扩展至行业领先的 1M tokens。Argon 目前正向 Fairwind Program 中的一批可信网络安全防御者开放,将尽快扩大可用范围。

    推荐理由:原文说明了该模型面向的三类复杂工作流场景和输出上限,读者可据此判断它对长任务工作流的适配程度。

  3. Google DeepMind78

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御者开放,随后将逐步面向开发者、企业和消费者推出,起步价为每百万输入 token 2 美元、每百万输出 token 10 美元。

    推荐理由:Gemini 4 Argon 的 1M 输出 token 与多项基准成绩,展示了长程复杂任务上的能力边界变化。

  4. AntLingAGI66

    蚂蚁百灵发布 Ling-3.1-flash:约 560B 总参数、每 token 约 25B 激活参数、最高 1M token 上下文,官方计划很快开源该模型。其在工作、编码与医疗三类评测上的成绩为 GDPVal-AA v2.1 拿到 1,673 Elo、FrontierSWE 75.16、HealthBench Professional 65.35。

    推荐理由:原文给出了参数规模、上下文长度和三项评测分数,读者可据此判断其定位与开源计划。

9月30日周三