去年7月,当大语言模型在IMO上夺得金牌时,我觉得AI或许有一天能解决数学中最难的一些问题。现在,一个OpenAI内部模型(仍在改进!)已经解决了一个千禧年难题。这一天来得如此之快,感觉很不真实!
#推理
#推理
weijie444@weijie444AI 评分 OpenAI@OpenAIAI 评分
OpenAI NewsAI 评分 OpenAI 分享 AI 生成的 Navier–Stokes 千禧年大奖难题解答
OpenAI 分享了一份由 AI 生成的 Navier–Stokes 千禧年大奖难题解答,包含一份书面说明和一份 Lean 形式化证明。
HBX_hbx@HBX_hbxAI 评分
axiommathai@axiommathaiAI 评分 1/ ✨ 今日在素数有界间隔上刷新世界纪录,这是数论中最古老的未解猜想之一。 我们证明了存在无穷多对素数,其间隔不超过 212。
Hugging Face BlogAI 评分
用 TRL 和 OpenEnv 训练编程模型画水彩
Hugging Face 博主用 TRL 和 OpenEnv 复现了 Surya Narreddi 让语言模型画水彩的思路,模型通过 p5.brush 写出约 150 行 JavaScript 作画,全部数据集、RL 环境、训练脚本与模型均已开源。
sundarpichai@sundarpichaiAI 评分
mingchikuo@mingchikuoAI 评分 郭明錤表示,行业调研显示 Nvidia 已恢复此前被认为被砍掉的 Rubin CPX 项目,预计 1Q27 量产,且 prefill 性能较旧设计更强。
mingchikuo@mingchikuoAI 评分 郭明錤称其最新产业调查显示,Nvidia 已重启此前被认为被移出产品蓝图的 Rubin CPX,预计于 1Q27 开始生产,重启版 prefill 效能更强,GPU 规格与机柜架构均有明显改变。
Meituan_LongCat@Meituan_LongCatAI 评分 美团 LongCat 评测了 7 个前沿模型在 36 项需要持续实验的 AI 研发任务上的表现,共覆盖 756 条轨迹,考察智能体如何框定方案、落地实现、保留进展并从失败中恢复。
analogalok@analogalok精选AI 评分 推荐理由:原文给出了完整的命令行参数与显存占用数据,读者可据此复现消费级显卡跑大模型的配置。
Hugging Face BlogAI 评分
IBM 发布 Granite 4.2 推理模型家族:3B、8B、30B 三档
IBM Granite 团队发布 Granite 4.2,这是其首个稠密 decoder-only 推理模型家族,包含 3B、8B、30B 三个规模,全部以 Apache 2.0 许可开源。
Hugging Face Blog精选AI 评分
Multiverse Computing 提出 Quantization-Aware Healing,4-bit 压缩模型在 7/9 基准上超过其 bfloat16 版本
Multiverse Computing 发布论文《Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs》,提出 QAH 方法:在结构压缩并量化后,直接从压缩前的原始模型蒸馏,而非从恢复出的 bfloat16 检查点蒸馏。
推荐理由:论文给出压缩加量化后从原始模型蒸馏的恢复配方,并附9项基准对比与QAT稳定性差异。
Hugging Face Blog精选AI 评分
Liquid AI 发布 LFM2.5-DSpark 草稿模型,推理最高提速 3.2 倍
Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 草稿模型检查点,通过投机解码在 GPU 上最高提升 3.18 倍吞吐、端侧最高 2.87 倍,且不改变输出质量。
推荐理由:Liquid AI 给出三款 LFM2.5 草稿模型的实测吞吐与函数调用延迟数据,可据此判断端侧推理的可用性。
Import AIAI 评分Import AI 469:科学 AI、RSI 模拟器与扎克伯格的技术悲观主义
Import AI 第 469 期介绍了 DiG-bench(Discovery in Games)基准,包含 70 款规则与目标均隐藏、需靠探索发现的游戏,其中 21 款已公开。
OpenAI NewsAI 评分 OpenAI 预览 Ultrafast 模式:GPT-5.6 Sol 最高提速 14 倍
OpenAI 预览新的 API 服务层级 Ultrafast,运行 GPT-5.6 Sol 时最高可提速 14 倍。该服务由 Cerebras 提供支持,输出速度最高可达每秒 750 个 token。
MSFTResearch@MSFTResearchAI 评分 一条路、一道栅栏、一个结。MindTopo 为测试 AI 对拓扑关系的理解设立了新基准,并揭示了强化空间推理与规划的新机会。msft.it/6011aH02S
Microsoft ResearchAI 评分 MindTopo 揭示多模态大模型的空间推理能力短板
微软研究院推出 MindTopo 基准,用于评测多模态大模型在连通性、封闭、顺序、分离与打结五类拓扑关系上的推理与规划能力。测试显示,模型在静态图像识别上表现明显优于交互式规划任务,且两者均远低于人类水平;失败多发生在规划阶段而非感知阶段,模型在场景变化中会丢失结构关系或提出违反物理约束的动作。图像与视频生成仅在单帧关系可见时偶有帮助,序列任务中仍不可靠。
Google ResearchAI 评分Google Research:前沿 LLM 的事实性瓶颈在召回而非编码
Google Research 提出知识画像框架,用 WikiProfile 基准(2,150 条维基百科事实、每条配 10 道题)区分编码与召回,发现 Gemini-3-Pro 和 GPT-5 有 95–98% 的事实已编码,却仍无法直接召回 26–34%,即使开启思考也失败 11–12%。
OpenAI NewsAI 评分 如何通过两个设置让 GPT-5.6 在 ARC-AGI-3 基准测试中得分提升三倍
OpenAI 通过启用两个 API 设置,让 GPT-5.6 在 ARC-AGI-3 基准测试中的得分提升至原来的三倍。这两个设置分别用于保留推理过程和启用压缩(compaction),在提升得分的同时也改善了效率。
Berkeley AI ResearchAI 评分
从 CUDA 到 MLX:K-Search 如何把数十年 kernel 经验带到 Apple Silicon
Berkeley Sky Lab 与 IBM Research 将演化式 kernel 搜索框架 K-Search 扩展到 MLX 后端,通过结构化 CUDA-to-MLX 翻译层把已有 CUDA kernel 知识迁移到 Apple Silicon。
OpenAI News精选AI 评分 GPT-5.6 如何兼顾前沿智能与效率
OpenAI 发布文章说明 GPT-5.6 如何在前沿智能与效率之间取得平衡,称其在模型、推理和智能体工作流上提升了 AI 效率,让每美元能获得更多有用智能。原文未给出具体性能数字或版本细节。
推荐理由:原文说明 GPT-5.6 在模型、推理与智能体工作流上提升效率,读者可据此了解其单位成本下的能力取向。
Berkeley AI ResearchAI 评分
Berkeley AI Research 提出 ABBEL:用信念状态监督让 LLM 高效长程交互
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的交互摘要隔离为自然语言"信念状态"并加以监督评分,替代完整交互历史作为智能体的工作上下文。在协作编程基准 CollabBench 上,采用重建式信念评分的 ABBEL-rec-BG 将自摘要模型与全上下文模型的性能差距缩小约 50%,训练步数从 100 步降至 50 步,峰值上下文 token 数也低于全上下文设置。
Hugging Face BlogAI 评分
模型路由并不简单:从分类问题到系统优化问题
在 AppWorld Test Challenge 的 417 个任务上,同一 CodeAct 智能体下 Claude Sonnet 4.6 总成本 79 美元(0.19 美元/任务),GPT-4.1 却要 155 美元(0.37 美元/任务),尽管后者 token 单价更低——缓存命中率才是关键。
Hugging Face Blog精选AI 评分
Thinking Machines 发布 1T 参数多模态开源模型 Inkling 及 Inkling-Small
Thinking Machines Lab 在 Hugging Face 发布多模态开源模型 Inkling,采用 decoder-only MoE 架构,975B 总参数、41B 激活参数,支持图像、音频、文本输入和 1M 上下文,训练数据为 45 万亿 token。
推荐理由:Inkling 以约 1T 参数、1M 上下文原生接收图像音频文本,并给出各推理引擎的部署配置与基准对比。
Mistral AI精选AI 评分
Mistral 发布 Robostral Navigate 具身导航模型
Mistral AI 发布首个具身导航模型 Robostral Navigate,这是一个 8B 模型,仅用单个普通 RGB 相机、无需 LiDAR 或深度传感器,在 R2R-CE validation unseen 上达到 76.6% 成功率,比最佳单相机方案高 9.7 个百分点,比使用深度或多相机的最佳系统高 4.5 个百分点。
推荐理由:官方给出单目 RGB 相机在 R2R-CE 上的成绩与训练方法,可对比多传感器方案的成本与效果。
Google Research精选AI 评分Google 用冻结多 Token 预测加速 Pixel 上的 Gemini Nano 模型
Google Research 提出一种将多 Token 预测(MTP)头接到已冻结的 Gemini Nano v3 模型上的架构,已在 Pixel 9 和 10 系列上线,用于 AI 通知摘要和 Proofread 等功能。
推荐理由:原文披露了冻结主干加 MTP 头的端侧推理方案,读者可了解手机端提速与省内存的具体做法。
Google ResearchAI 评分Google Research 研究:推理如何解锁 LLM 的参数化知识回忆
Google Research 在 COLM 2026 发表的论文揭示,推理轨迹能解锁 LLM 原本无法触及的参数化知识,即使面对 SimpleQA Verified 和 EntityQuestions 上的简单单跳事实问题。
OpenAI NewsAI 评分 GPT-5.5 Instant 如何提升 ChatGPT 的健康智能
OpenAI 用 GPT-5.5 Instant 改进 ChatGPT 的健康与养生回答,强化推理、上下文理解与表达清晰度,并引入医生参与设计的评估。该版本针对健康类问题优化,具体上线范围与参数未披露。
OpenAI NewsAI 评分 研究用 OpenAI 推理模型辅助医生诊断儿童罕见遗传病
研究人员使用 OpenAI 的推理模型辅助诊断罕见疾病,在先前未解决的病例中识别出 18 例新诊断。
Google DeepMind精选AI 评分Google DeepMind 发布 DiffusionGemma:文本扩散模型,推理速度最高提升 4 倍
Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式并行生成整块文本,在专用 GPU 上推理速度最高提升 4 倍。
推荐理由:官方给出 26B MoE 文本扩散模型的速度数据与硬件门槛,可据此判断本地交互式推理的可行边界。
Google DeepMind精选AI 评分Google DeepMind 发布 Gemma 4 12B:统一无编码器多模态模型
Google DeepMind 发布 Gemma 4 12B,定位为可在笔记本本地运行的多模态模型,介于边缘端 E4B 与 26B MoE 之间,是首个支持原生音频输入的中等规模 Gemma 模型。
推荐理由:Gemma 4 12B 用无编码器架构把视觉和音频直接接入 LLM,并给出 16GB 显存本地运行的边界。
Import AIAI 评分Import AI 460:社会规则奖励攻击基准、Anthropic 自我改进数据与 RL 无人机竞速
本期 Import AI 汇总三项研究。伦敦国王学院、复旦大学与 Alan Turing Institute 构建了 SocioHack 基准,包含 72 个沙盒社会环境,测试 RL 训练的模型能否发现合规但违背制度意图的漏洞,模型在历史法规环境中以 61.25% 召回率和 90.85% 精确率重新发现已被修补的漏洞。
Hugging Face Blog精选AI 评分
NVIDIA 发布 Nemotron 3.5 Content Safety 多模态安全模型
NVIDIA 发布 Nemotron 3.5 Content Safety,基于 Gemma 3 4B IT 微调,把多模态输入、多语言覆盖、自定义企业策略执行和可审计推理统一到一次推理调用中。
推荐理由:NVIDIA 把多模态、多语言、自定义策略与可审计推理合并进一次推理调用,并公开训练数据集。
OpenAI News精选AI 评分 OpenAI 为 GPT-Rosalind 推出新能力
OpenAI 为 GPT-Rosalind 推出新能力,面向生命科学研究,增强生物推理、药物化学专长、基因组分析与实验工作流能力。
推荐理由:OpenAI 公布 GPT-Rosalind 在生物推理、药物化学与基因组分析上的能力扩展,读者可据此了解该模型在生命科学场景的定位。
OpenAI News精选AI 评分 OpenAI 模型推翻离散几何核心猜想
OpenAI 表示其模型解决了有 80 年历史的单位距离问题,推翻离散几何中的一个重要猜想,被视为 AI 驱动数学的一个里程碑。
推荐理由:OpenAI 模型推翻离散几何中一个长期猜想,读者可了解 AI 在数学证明上的进展。
Hugging Face BlogAI 评分
如何在连续批处理中实现异步化:分离 CPU 与 GPU 负载提升推理吞吐
Hugging Face 详解如何在连续批处理中引入异步化,把 CPU 批次准备与 GPU 批次计算解耦并行执行。同步批处理下 CPU 与 GPU 轮流工作,用 8B 模型、batch size 32 生成 8K tokens 耗时 300.6 秒,其中 24.0% 时间 GPU 处于空闲等待 CPU。
Berkeley AI ResearchAI 评分
自适应并行推理:高效推理扩展的新范式
伯克利 AI 研究团队梳理了并行推理领域进展,重点分析自适应并行推理——让模型自行决定何时分解并并行化独立子任务、生成多少并发线程以及如何协调。现有方法如 Self-consistency、Best-of-N、Tree of Thoughts、MCTS、ParaThinker、GroupThink、Hogwild! Inference 的并行结构多由外部设定,而非模型自主选择。
Hugging Face BlogAI 评分
vLLM V0 到 V1 迁移:RL 训练中先对齐正确性再改目标
PipelineRL 在 vLLM V0 到 V1 迁移中通过四项修复让 V1 与 V0 参考轨迹对齐:启用 processed_logprobs、显式关闭 prefix caching 与 async scheduling、匹配 inflight 权重更新路径,以及最终投影使用 fp32 lm_head。