跳到正文

#推理

今日 10 条
今天10月3日周六
  1. X:OpenRouter (@OpenRouter)60

    Liquid AI 的 D1 决策模型上线 OpenRouter

    Liquid AI 的 D1 模型已在 OpenRouter 上线,这是一个决策模型,输入应用状态和是/否、选择或评分问题,返回带每个选项概率的类型化答案。该模型零数据留存,定价为 $0.04/M 输入、$0 输出,上下文窗口 65K。

  2. X:SemiAnalysis (@SemiAnalysis_)26

    SemiAnalysis Weekly:GPU 是不是印钞机?InferenceX 团队解析 Engram 内存卸载、AgentX 利润计算器、TPU v7 与 Vera Rubin vs. Blackwell

    SemiAnalysis Weekly 新一期由 Jordan Nanos 主持,Cam Quilici、Bryan Shan 和 Alec Ibarra 参与,InferenceX 团队解析了 Engram 内存卸载、AgentX 利润计算器、TPU v7、Vera Rubin 与 Blackwell 的对比,以及更快的 token 是否值得溢价。

  3. X:Karina Nguyen(@karinanguyen)41

    Repovive 数学竞赛 AI 判卷评测:GPT 与 Claude 模型评判数学证明的能力对比

    Repovive 联合 IOI、IMO、ICPC 决赛选手评测 AI 判卷能力,从数学竞赛中选出 534 份可疑或边缘提交,建立统一评分标准与专家参考判断。模型整体偏严,更常拒绝有效提交;清晰指令让 GPT 模型平均提升约 2 个百分点,加入评分示例后 Claude 平均提升约 10 个百分点、GPT 约 5 个百分点。Grok 几乎拒绝一切,仅接受 1–5% 提交,而金标准接受 64.4%。

  4. X:AI at Meta (@AIatMeta)62

    Meta 发布数学家与 Muse Spark 协作完成的六篇论文

    Meta 分享六篇论文,来自数学家与 Muse Spark 1.1、Muse Spark 1.2 在 Thinking Mode 下通过常规 meta.ai 聊天界面协作求解开放数学问题,未使用定制研究框架。合作遵循数学家主导研究、第二组数学家评审、论文标注人机撰写段落并致谢所依据的先前研究等原则,对同一问题其他团队的独立解法也予以承认。

10月2日周五
  1. MIT Technology Review · AI38

    别被迷惑——LLM 并不会推理

    前 Google DeepMind 研究员指出,LLM 靠逐个预测 token 生成答案,其思维链仍由同一套下一 token 预测产生,并非 AlphaGo 那种独立搜索机制,因此不构成真正的推理。他列举三大缺陷:模型没有显式可检查的认知状态、知识与推理在权重中纠缠不清、思维链常是事后编造。为此他离开 Google DeepMind,主张借鉴 AlphaGo 架构,让系统维护可更新的认知状态。

  2. X:ARC Prize (@arcprize)42

    ARC Prize 回应 Qwen3.8-27B 榜单成本估算方式,ARC-AGI-3 结果待测试完成

    ARC Prize 表示 Qwen3.8-27B 的榜单成本是按阿里云公开 token 价格乘以记录的 token 用量估算,而非其专用推理收费。该模型经 Baseten 测试,使用自带 chat template:low 要求思考简短聚焦,xhigh 要求仔细思考并检查假设,medium 两者都不加。ARC-AGI-3 结果将在测试完成后公布。

10月1日周四
  1. Latent Space78

    Google DeepMind 发布 Gemini 4 Argon,支持 1M token 输出

    Google DeepMind 推出 Gemini 4 Argon,面向编码、企业知识工作与网络防御,首批开放给 Fairwind 计划的政府用户与可信网络安全人员,后续再向开发者、企业和消费者开放。

    推荐理由:汇总了 Gemini 4 Argon 的基准、定价与可用范围,并列出同期多家模型与工具的动态,便于横向比较。

  2. X:ARC Prize (@arcprize)50

    ARC Prize:GPT-6.1 Sol 在 ARC-AGI-3 上更高推理档位决策更优、推理成本更低

    ARC Prize 称 GPT-6.1 Sol 在 ARC-AGI-3 上提高推理档位后决策更优,完成关卡所需动作更少,从而降低了总推理成本。在 sk48 上,使用 provider adapter(保留跨轮不透明推理状态并支持自动压缩)时,max reasoning 的 GPT-6.1 Sol 以 463 个动作完成游戏,而 low reasoning 用了 1,078 个。

  3. Google DeepMind78

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御者开放,随后将逐步面向开发者、企业和消费者推出,起步价为每百万输入 token 2 美元、每百万输出 token 10 美元。

    推荐理由:Gemini 4 Argon 的 1M 输出 token 与多项基准成绩,展示了长程复杂任务上的能力边界变化。

  4. X:ARC Prize (@arcprize)38

    Astra 在 ARC-AGI-3 上得分 99.9%,ARC Prize 推出交互式探索方式

    Astra 在 ARC-AGI-3 上得分 99.9%,ARC Prize 为此构建了一个交互式页面,让用户亲自试玩模型受测的游戏,并阅读 Astra 自己运行过程留下的笔记。有评论质疑该成绩并未体现理解能力,认为关键在于弄清这些游戏的机制,而 Astra 的笔记中看不到它如何预判新关卡会发生什么。

9月30日周三
  1. X:ARC Prize (@arcprize)62

    GLM 5.3 Flash 在 ARC-AGI-2 取得 65.8%,单任务成本 0.09 美元

    ARC Prize 公布智谱 GLM 5.3 Flash 在 ARC-AGI 上的 Verified 结果:ARC-AGI-2 得分 65.8%,每任务成本 0.09 美元;ARC-AGI-1 得分 91.0%,每任务成本 0.04 美元。ARC Prize 称该模型在两个基准上表现强劲,且每任务成本均低于 0.10 美元,并提供了排行榜、复现仓库、测试政策与完整结果链接。

9月29日周二
9月24日周四
9月21日周一
9月18日周五
9月17日周四
  1. X:商汤 SenseTime (@SenseTime_AI)71

    商汤发布 SenseNova U1.5 技术报告:开源 8B-MoT 原生统一模型

    商汤发布 SenseNova U1.5 技术报告,推出开源 8B-MoT 原生统一模型,通过共享注意力连接理解与生成。模型采用 Pixel Shuffle 加 3×3 空间卷积实现原生 4K 生成,并用多专家在线策略蒸馏整合美学、OCR、信息图与编辑能力。

    推荐理由:技术报告与训练配方同步开源,读者可据此了解统一多模态模型如何打通理解与生成。

9月16日周三
9月9日周三