跳到正文

#推理

今日 5 条
4月22日周三
4月20日周一
  1. Berkeley AI Research33

    GRASP:面向世界模型长时程规划的梯度规划器

    伯克利 AI 研究提出 GRASP,一种面向学习动力学(世界模型)的梯度规划器,通过将轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代中直接注入随机性以探索、并重塑梯度让动作获得清晰信号,同时避开高维视觉模型中脆弱的“状态-输入”梯度,使长时程规划更实用、更鲁棒。该工作由 Mike Rabbat、Aditi Krishnapriyan、Yann LeCun 与 Amir Bar 合作完成。

4月16日周四
  1. Google Research38

    Google 提出 Simula:面向真实世界的合成数据集机制设计与推理框架

    Google 提出推理优先的合成数据生成框架 Simula,无需种子数据,将数据集构建拆解为全局多样化、局部多样化、复杂化和质量检查四个可控维度,并以 Gemini 2.5 Flash 为教师模型、Gemma-3 4B 为学生模型在网络安全、法律推理、GSM8k 和 Global MMLU 等五个领域生成最多 512K 数据点。

  2. OpenAI News66

    OpenAI 发布生命科学研究模型 GPT-Rosalind

    OpenAI 发布 GPT-Rosalind,一款面向生命科学研究的前沿推理模型。该模型用于加速药物发现、基因组分析、蛋白质推理和科研工作流。

    推荐理由:OpenAI 推出面向生命科学的前沿推理模型,读者可了解其针对药物发现与基因组分析的能力定位。

3月25日周三
3月17日周二
  1. Mistral AI77

    Mistral 发布 Mistral Small 4,统一推理、多模态与编码智能体能力

    Mistral AI 发布 Mistral Small 4,这是 Mistral Small 系列的下一个重要版本,也是 Mistral 首个把 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力统一到单一模型中的模型,采用 Apache 2.0 许可。

    推荐理由:Mistral Small 4 把推理、多模态与编码智能体能力合并进单一开源模型,读者可据此判断统一模型对部署选型的影响。

3月13日周五
  1. Berkeley AI Research26

    伯克利提出 SPEX 与 ProxySPEX:为 LLM 大规模识别特征交互

    伯克利 AI 研究团队提出 SPEX 与 ProxySPEX 算法,可在特征、数据和模型组件归因中大规模识别关键交互。SPEX 利用稀疏性与低阶性将交互搜索转化为稀疏恢复问题,ProxySPEX 进一步借助层级结构,以约少 10 倍的消融次数达到 SPEX 的性能。在情感分析任务上,SPEX 在上下文扩展至数千特征时仍保持高忠实度,优于 LIME、Banzhaf 等边际方法。

3月9日周一
  1. Google DeepMind35

    AlphaGo 十周年:从围棋到生物学,DeepMind 回顾其对 AI 与科学的深远影响

    距 AlphaGo 成为首个击败围棋世界冠军的程序已十年,其"第 37 手"证明 AI 能超越模仿人类、发现全新策略。这一突破直接催生了 AlphaFold 2,已折叠科学界已知的 2 亿个蛋白质结构并免费开放,全球超 300 万研究人员使用该数据库。AlphaGo 的搜索与强化学习方法还延伸至 AlphaProof、AlphaEvolve 及 AI co-scientist 等系统。

3月5日周四
  1. OpenAI News62

    OpenAI 提出 CoT-Control:推理模型难以控制自身思维链

    OpenAI 提出 CoT-Control,发现推理模型难以控制自己的思维链,这一结果支持将可监控性作为 AI 安全防护手段。材料仅提供摘要,未给出具体模型、评测指标或实验细节。

    推荐理由:OpenAI 提出 CoT-Control 并给出推理模型难以控制思维链的观察,为可监控性作为安全手段提供了依据。

  2. Google Research37

    Google 如何教 LLM 像贝叶斯那样推理

    Google Research 提出"贝叶斯教学"方法,通过监督微调让 LLM 模仿贝叶斯助手在航班推荐任务中的预测,从而学会概率推理。在五轮模拟用户交互中,未经训练的 LLM 表现明显逊于最优贝叶斯助手,且往往在单次交互后性能就停滞,难以随新信息持续更新;而贝叶斯教学不仅提升该任务表现,还能泛化到其他任务。

3月4日周三
  1. Google DeepMind66

    Google DeepMind 发布 Gemini 3.1 Flash-Lite

    Google DeepMind 推出 Gemini 3.1 Flash-Lite,定位 Gemini 3 系列中速度最快、成本最低的模型,即日起通过 Gemini API 在 Google AI Studio 和 Vertex AI 面向开发者预览。

    推荐理由:官方给出定价、速度与基准数据,读者可据此判断高并发场景下是否值得替换现有模型。

2月20日周五
2月13日周五
  1. OpenAI News62

    GPT-5.2 在理论物理中推导出新结果

    OpenAI 发布新预印本,显示 GPT-5.2 为一个胶子振幅提出了新公式,随后由 OpenAI 与学术合作者正式证明并验证。该结果以预印本形式公开。

    推荐理由:OpenAI 与学术合作者披露 GPT-5.2 提出胶子振幅新公式并被形式化证明,可观察大模型参与理论物理推导的路径。

2月10日周二
  1. Google DeepMind74

    Google DeepMind 发布两篇论文,用 Gemini Deep Think 推进数学与科学发现

    Google DeepMind 发布两篇论文,介绍在数学家、物理学家和计算机科学家指导下,用 Gemini Deep Think 模式解决数学、物理与计算机科学领域的专业研究问题。

    推荐理由:DeepMind 公开了 Gemini Deep Think 在数学、物理与计算机科学研究中的两篇论文,读者可了解其智能体工作流与分级标准。

2月5日周四
  1. OpenAI News78

    OpenAI 发布 GPT-5.3-Codex

    OpenAI 发布 GPT-5.3-Codex,这是一个 Codex 原生的智能体,将前沿编码能力与通用推理结合,用于支持长周期、真实世界的技术工作。

    推荐理由:OpenAI 发布 Codex 原生的 GPT-5.3-Codex,读者可据此了解其编码能力与通用推理结合后的定位。

  2. OpenAI News67

    OpenAI 发布 GPT-5.3-Codex 系统卡

    OpenAI 发布 GPT-5.3-Codex 系统卡,称其为目前能力最强的智能体编码模型。该模型结合了 GPT-5.2-Codex 的前沿编码性能与 GPT-5.2 的推理和专业领域知识能力。

    推荐理由:官方系统卡给出 GPT-5.3-Codex 的能力定位,读者可据此了解它在编码与推理上的组合方式。

1月27日周二
  1. Hugging Face Blog38

    解锁 GPT-OSS 的智能体 RL 训练:一次实践复盘

    Hugging Face 博客复盘了用 verl 框架对 GPT-OSS 进行智能体强化学习训练时遇到的问题与修复。团队发现 GPT-OSS-20B 训练初期出现 KL 散度和熵爆炸、奖励不升,根因是 MoE 架构下双前向传播导致新旧 log-prob 不一致,使 PPO 的 importance sampling ratio 偏离 1;修复后该方案同样适用于 GPT-OSS-120B。

1月20日周二
1月16日周五
  1. Google DeepMind62

    Google DeepMind 发布 D4RT 模型,统一 4D 场景重建与追踪

    Google DeepMind 发布 D4RT(Dynamic 4D Reconstruction and Tracking),一个统一 4D 场景重建与追踪的 AI 模型,采用编码器-解码器 Transformer 架构和查询机制,可同时完成点追踪、点云重建和相机位姿估计。

    推荐理由:D4RT 把动态场景重建统一进单一查询式框架,读者可了解其速度提升与机器人、AR 等落地方向。

1月14日周三
1月6日周二
  1. Hugging Face Blog62

    NVIDIA 发布 Cosmos Reason 2 推理视觉语言模型

    NVIDIA 发布面向物理 AI 的开源推理视觉语言模型 Cosmos Reason 2,提供 2B 和 8B 两种参数规模,并在 Physical AI Bench 与 Physical Reasoning 榜单上成为排名第一的开源模型。

    推荐理由:Cosmos Reason 2 把上下文从 16K 扩到 256K 并新增轨迹与 2D/3D 定位能力,可据此判断物理 AI 智能体的视频理解边界。

1月5日周一
12月24日周三
12月19日周五
12月18日周四
12月17日周三
12月16日周二
  1. Google Research62

    Google 为 STOC 2026 推出 Gemini 论文助手 PAT

    Google Research 为 STOC 2026 打造实验性 Paper Assistant Tool(PAT),基于 Gemini 2.5 Deep Think 的推理扩展方法,在投稿后 24 小时内给出结构化预审反馈。

    推荐理由:Google 披露 PAT 在 STOC 2026 的试用数据,读者可据此判断 AI 预审在数学证明类写作中的实际边界。

12月11日周四
  1. OpenAI News70

    OpenAI 发布 GPT-5.2,在数学与科学基准上刷新成绩

    OpenAI 发布 GPT-5.2,称其为目前数学与科学能力最强的模型,在 GPQA Diamond 和 FrontierMath 等基准上取得新的 SOTA 结果。官方表示这些提升已转化为实际研究进展,包括解决一个开放理论问题并生成可靠的数学证明。

    推荐理由:原文给出 GPT-5.2 在 GPQA Diamond 与 FrontierMath 上的新结果,读者可据此了解其在数学与科研任务上的能力边界。

  2. OpenAI News82

    OpenAI 发布 GPT-5.2 前沿模型

    OpenAI 发布 GPT-5.2,称其为面向日常专业工作最先进的前沿模型,具备最先进的推理、长上下文理解、编码和视觉能力。该模型可在 ChatGPT 和 OpenAI API 中使用,用于支撑更快、更可靠的智能体工作流。

    推荐理由:OpenAI 公布 GPT-5.2 在推理、长上下文、编码与视觉上的定位,读者可据此判断日常专业工作与智能体流程的升级方向。

12月5日周五
12月4日周四
12月3日周三
11月25日周二
  1. Hugging Face Blog29

    从第一性原理理解 continuous batching

    Hugging Face 发布博客,从注意力机制与 KV 缓存出发,推导出 continuous batching 这一推理优化技术。该方法通过并行处理多个对话、完成即换出,来最大化高负载场景下的吞吐量。文中指出注意力是 token 间唯一交互之处,其计算量随序列长度呈平方增长。

11月24日周一
11月20日周四
11月19日周三
  1. Hugging Face Blog60

    ServiceNow 发布 Apriel-H1:将 15B 推理模型蒸馏为 Mamba 混合架构,吞吐提升 2.1 倍

    ServiceNow 的 SLAM Lab 发布 Apriel-H1,把 15B 推理模型改造成 Mamba 混合架构,旗舰版 Apriel-H1-15b-Thinker-SFT 实现 2.1 倍吞吐且质量损失很小,MATH500 从 0.90 升到 0.92、MTBench 从 8.30 升到 8.58,GSM8k、GPQA、AIME24 略有下降。

    推荐理由:ServiceNow 公开了把 15B 推理模型蒸馏成 Mamba 混合架构的完整流程与七个 checkpoint,可看到效率与质量的取舍曲线。

  2. Google DeepMind92

    Google DeepMind 发布 Gemini 3 Pro,并推出 Gemini 3 Deep Think 与 Antigravity 平台

    Google DeepMind 发布 Gemini 3,首发 Gemini 3 Pro 预览版,同步上线 Gemini app、Search 的 AI Mode、AI Studio、Vertex AI、Gemini CLI 及新智能体开发平台 Google Antigravity。

    推荐理由:官方给出 Gemini 3 Pro 在推理、多模态与编码基准上的具体分数和上线渠道,可据此判断能力代际变化。