GPT-5.2 Pro 助力将单负振幅扩展至引力子
OpenAI 发布新预印本,将单负振幅扩展至引力子,GPT-5.2 Pro 参与推导并验证了量子引力中非零的引力子树振幅。
OpenAI 发布新预印本,将单负振幅扩展至引力子,GPT-5.2 Pro 参与推导并验证了量子引力中非零的引力子树振幅。
OpenAI 分享了其 AI 模型针对 First Proof 数学挑战的证明尝试,用于测试模型在专家级问题上的研究级推理能力。
IBM Research 与 UC Berkeley 用 MAST 失败分类法分析 ITBench 中 310 条 SRE 执行轨迹,覆盖 Gemini-3-Flash、Kimi-K2 和 GPT-OSS-120B 三类模型。
OpenAI 与 Paradigm 联合推出 EVMbench,用于评估 AI 智能体检测、修补和利用高危智能合约漏洞的能力。该基准聚焦高严重性漏洞的发现、修复与攻击三类任务。
Google Research 提出 MapTrace,用 Gemini 2.5 Pro 与 Imagen-4 构建全自动合成数据管线,生成 200 万条带路径标注的地图问答对并已开源。该管线经地图生成、Mask Critic 筛选可通行区域、构建像素图、Dijkstra 求最短路加 Path Critic 校验四步,在 23,000 条路径上微调多个 MLLM 以提升细粒度空间推理能力。
Google Research 在 ACM UIST 2025 发布开源原型框架 DialogLab,用于编写、模拟和测试动态的人-AI 群组对话,将对话的社交设定与时间推进解耦,支持拖拽式场景搭建、实时预览与验证仪表盘。14 名游戏设计、教育和社会科学领域参与者的评测显示,human control 模式在参与度、有效性和真实感上显著优于 autonomous 与 reactive 模式。
Google Research 与 Google DeepMind 发现,主要用鸟类等陆生动物音频训练的 Perch 2.0 生物声学基础模型,在未接触任何水下音频的情况下,仍能作为嵌入模型有效迁移到海洋任务,用于区分须鲸物种和虎鲸生态型。
Google DeepMind 发布两篇论文,介绍在数学家、物理学家和计算机科学家指导下,用 Gemini Deep Think 模式解决数学、物理与计算机科学领域的专业研究问题。
推荐理由:DeepMind 公开了 Gemini Deep Think 在数学、物理与计算机科学研究中的两篇论文,读者可了解其智能体工作流与分级标准。
Google Research 提出 Sequential Attention,用贪心选择机制在单次训练中顺序、自适应地挑选最佳组件,把子集选择直接整合进模型训练,避免传统贪心算法带来的数量级训练开销。该方法在多个神经网络基准上取得 SOTA,并实现快速单遍贪心选择,可用于特征选择、嵌入维度调优和权重剪枝,兼顾效率、精度、可解释性与可扩展性。
Google Research 发布论文《Towards a Science of Scaling Agent Systems》,对 180 种智能体配置做大规模对照评测,覆盖 Finance-Agent、BrowseComp-Plus、PlanCraft、Workbench 四个基准和 GPT、Gemini、Claude 三个模型家族。
推荐理由:通过 180 种智能体配置的对照实验,给出多智能体架构在并行与串行任务上的量化差异,可据此调整编排策略。
Google Research 提出 ATLAS 多语言缩放定律,基于 774 次训练运行、10M–8B 参数模型、400+ 语言数据,可指导模型规模与语言配比选择。其跨语言迁移矩阵显示,支持语言数翻倍时模型规模需增至 1.18 倍、数据量增至 1.66 倍。该研究将发表于 ICLR 2026。
Hugging Face 团队推出 Alyah(阿联酋方言中意为"北极星")基准,用于评估阿拉伯语 LLM 对阿联酋方言的语言、文化与语用理解能力。该基准包含 1,173 个由阿联酋母语者手工收集的多选题样本,覆盖问候语、诗歌、 heritage 知识等七类内容。
Google 在 NeurIPS 2025 提出 GIST(Greedy Independent Set Thresholding)算法,用于训练数据子集选择,在多样性与效用之间取得平衡。GIST 是首个为该权衡提供可证明保证的算法,保证所选子集价值至少为最优解的一半,并在图像分类等基准任务上超越现有方法。
Google Research 在 EMNLP 2025 发表的论文提出一种分解式方法,将用户意图理解拆为两步:先用小型多模态 LLM 逐屏总结交互,再从摘要序列中提取意图。在移动端和网页轨迹上,该方法优于 CoT 提示和端到端微调,Gemini 1.5 Flash 8B 配合该方法的意图提取效果可与 Gemini 1.5 Pro 相当,成本与速度仅为后者一小部分。
Hugging Face 发布 AssetOpsBench,一个面向工业资产运维的智能体评测基准,包含 2.3M 传感器遥测点、140+ 场景、4.2K 工单和 53 种结构化故障模式,覆盖 4 个智能体。
微软发布 Differential Transformer V2(DIFF V2),通过将查询头数翻倍、保持 KV 头数不变,使解码速度与标准 Transformer 持平,且无需自定义注意力 kernel。
Google Research 提出一种基于时序卷积网络(TCN)的多头深度学习模型,仅用单只 Pixel Watch 的 IMU 信号(50 Hz 三轴加速度计与陀螺仪)加用户身高,即可直接估算步速、步长、摆动时间、支撑时间和双脚支撑时间等步态指标。
Google Research 在 Science Advances 发表论文,介绍 NeuralGCM 直接使用 2001 至 2018 年 NASA 卫星降水观测训练其机器学习部分,而非依赖再分析数据。
推荐理由:NeuralGCM 改用卫星降水观测训练后,在 15 天预报与数十年气候模拟中对比 ECMWF 等模型的误差变化值得关注。
Berkeley AI Research 提出一种基于互信息的成像系统评估与优化框架,可直接从含噪测量中估计信息量,预测系统性能。该方法在彩色摄影、射电天文、无透镜成像和显微镜四个领域验证有效,优化后的设计达到端到端方法水平,且内存和计算需求更低、无需任务专用解码器。相关成果发表于 NeurIPS 2025 论文。
OpenAI 推出针对思维链可监控性的新框架与评测套件,覆盖 24 种环境下的 13 项评估。结果显示,监控模型内部推理远比仅监控输出更有效,为 AI 系统能力提升后的可扩展控制提供了可行路径。
OpenAI 发布 FrontierScience 基准,用于测试 AI 在物理、化学和生物学领域的推理能力,衡量其向真实科学研究迈进的进展。
OpenAI 提出一套真实世界评估框架,用于衡量 AI 在湿实验室中加速生物学研究的能力,并用 GPT-5 优化分子克隆实验方案。该工作同时探讨了 AI 辅助实验的前景与风险。
Google Research 在 COLM 2025 论文中提出 Urania 框架,通过 DP 聚类与 DP 关键词提取,从 LLM 聊天记录中生成带端到端差分隐私保证的使用洞察。该框架让 LLM 只基于匿名关键词生成摘要,不接触原始对话,从而抵御提示注入等泄露风险。评测中 DP 摘要被 LLM 评审偏好的比例最高达 70%,但隐私预算收紧会降低主题覆盖度。
Google DeepMind 联合 Kaggle 发布 FACTS Benchmark Suite,在原有 FACTS Grounding 基础上新增 Parametric、Search、Multimodal 三项基准,并将 Grounding 升级至 v2,共 3,513 个公开样例。
Google Research 发布 Titans 架构与 MIRAS 理论框架,将深度神经网络作为长期记忆模块,结合 RNN 的速度与 Transformer 的精度。
推荐理由:Google Research 提出 Titans 架构与 MIRAS 框架,用深度神经网络做长期记忆模块,读者可了解长上下文建模的新思路。
密歇根州立大学 Berkley Walker 团队借助 AlphaFold 预测植物与嗜热藻类中光合作用关键酶 GLYK 的 3D 结构,发现植物版 GLYK 的三个柔性环在高温下变形失稳。研究人员据此用藻类 GLYK 中更刚性的环替换植物版的不稳定环,构建出杂合酶,其中一种在高达 65 °C 下仍保持稳定。
Intel AI Software Group 推出 DeepMath,一个基于 Qwen3-4B Thinking 并用 GRPO 微调的数学推理 Agent,通过 smolagents 实现,让模型生成 Python 片段在沙箱中执行并回填结果。
Google Research 在 NeurIPS 2025 发布 Massive Sound Embedding Benchmark(MSEB),用统一框架评估声音嵌入在检索、推理、分类、转录、分割、聚类、重排、重建八项任务上的表现。
OpenAI 研究人员正在测试一种名为"confessions"的方法,训练模型在犯错或做出不当行为时主动承认,以提升 AI 的诚实性、透明度以及人们对模型输出的信任。
Google DeepMind 发布博文介绍,密苏里大学研究人员借助 AlphaFold 与冷冻电镜(cryo-EM)数据,解析出“坏胆固醇”关键蛋白 apoB100 的结构。
推荐理由:AlphaFold 预测与冷冻电镜数据结合解析 apoB100 结构,展示了 AI 在结构生物学中的具体用法。
Google 设计了一个基于线性回归的轻量模型,预测某充电站在未来若干分钟后仍有空闲充电桩的概率,用于将充电站纳入 EV 导航路线以缓解续航焦虑。该模型仅以一天中的小时作为特征,在 30 至 60 分钟预测窗口、至少 6 个充电桩的站点上,表现优于"保持当前状态"这一强基线,主要靠识别高占用周转的少数关键时刻。
Hugging Face 的 Open ASR Leaderboard 新增多语言与长音频转录赛道,并发布基于 60+ 模型的 ASR 趋势预印本。
Google Research 发布端到端语音到语音翻译(S2ST)模型,直接在原说话人音色下生成翻译音频,延迟仅 2 秒,而此前的级联方案延迟为 4–5 秒且会累积误差。
推荐理由:Google 端到端语音翻译把延迟从 4–5 秒压到 2 秒,并已落地 Meet 与 Pixel 10,可据此了解实时同传的技术取舍。
ServiceNow 的 SLAM Lab 发布 Apriel-H1,把 15B 推理模型改造成 Mamba 混合架构,旗舰版 Apriel-H1-15b-Thinker-SFT 实现 2.1 倍吞吐且质量损失很小,MATH500 从 0.90 升到 0.92、MTBench 从 8.30 升到 8.58,GSM8k、GPQA、AIME24 略有下降。
推荐理由:ServiceNow 公开了把 15B 推理模型蒸馏成 Mamba 混合架构的完整流程与七个 checkpoint,可看到效率与质量的取舍曲线。
Google DeepMind 联合 Google Research 发布 Natural Forests of the World 2020,这是首个全球一致、10 米分辨率的天然林地图与数据集,在独立全球数据集上验证准确率达 92.2%。
Google DeepMind 发布 SIMA 2,通过将 Gemini 模型嵌入智能体核心,使其从指令执行者升级为可推理目标、与用户对话并自我改进的交互式游戏伙伴。
推荐理由:SIMA 2 把 Gemini 的推理能力接入 3D 游戏智能体,读者可了解其在泛化与自我改进上的具体进展与当前限制。
OpenAI 正在探索机制可解释性,以理解神经网络如何进行推理。其提出的稀疏模型方法有望让 AI 系统更透明,并支持更安全、更可靠的行为。
Google Quantum AI 联合斯坦福、MIT、Caltech 在 Nature 发表论文,提出量子算法 Decoded Quantum Interferometry(DQI),利用量子干涉将优化问题转化为解码问题求解。
Google DeepMind 在 Nature 发表新论文,提出三步对齐方法,将视觉模型的内部表征重组得更接近人类认知。研究基于 THINGS 数据集训练 SigLIP-SO400M 适配器作为教师模型,生成含百万张图像、数百万条类人判断的 AligNet 数据集,再微调学生模型。对齐后模型表征按人类概念层级结构化,鲁棒性与泛化能力提升。
Google Research 在 NeurIPS 2025 论文中提出 Nested Learning,将模型架构与优化算法统一视为多层嵌套的优化问题,每层拥有各自的 context flow 和更新频率,以缓解灾难性遗忘。