GRASP:面向世界模型长时程规划的梯度规划器
伯克利 AI 研究提出 GRASP,一种面向学习动力学(世界模型)的梯度规划器,通过将轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代中直接注入随机性以探索、并重塑梯度让动作获得清晰信号,同时避开高维视觉模型中脆弱的“状态-输入”梯度,使长时程规划更实用、更鲁棒。该工作由 Mike Rabbat、Aditi Krishnapriyan、Yann LeCun 与 Amir Bar 合作完成。
伯克利 AI 研究提出 GRASP,一种面向学习动力学(世界模型)的梯度规划器,通过将轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代中直接注入随机性以探索、并重塑梯度让动作获得清晰信号,同时避开高维视觉模型中脆弱的“状态-输入”梯度,使长时程规划更实用、更鲁棒。该工作由 Mike Rabbat、Aditi Krishnapriyan、Yann LeCun 与 Amir Bar 合作完成。
Google 提出推理优先的合成数据生成框架 Simula,无需种子数据,将数据集构建拆解为全局多样化、局部多样化、复杂化和质量检查四个可控维度,并以 Gemini 2.5 Flash 为教师模型、Gemma-3 4B 为学生模型在网络安全、法律推理、GSM8k 和 Global MMLU 等五个领域生成最多 512K 数据点。
Google Research 提出 MoGen(Neuronal Morphology Generation),基于 PointInfinity 点云流匹配模型生成合成神经元形状,为 PATHFINDER 重建模型补充训练数据,使小鼠轴突重建误差降低 4.4%,主要来自 merge error 的减少。
Google Research 推出 ConvApparel 数据集,包含服装购物领域超 4,000 段人机多轮对话、近 15,000 轮次,用于量化 LLM 用户模拟器与真实人类的真实感差距。
Google 发布两个学术智能体框架:PaperVizAgent(原 PaperBanana)从论文方法与图注生成出版级插图,ScholarPeer 则自动评审论文。
Google Research 提出一套框架,用改编自 IRI、ERQ 等心理学问卷的情境判断测试(SJT)评估 LLM 行为倾向与人类的一致性,覆盖 25 个 LLM。结果显示,模型规模超过 120B 及前沿闭源模型在人类标注者一致时接近完美对齐,但共识低于 90% 时对齐率停滞在 80% 出头;模型还在职场场景中倾向情绪外露、在社交争端中偏好和谐而非坚持立场。
Google Research 在《Forest vs Tree: The (N, K) Trade-off in Reproducible ML Evaluation》中研究了标注条目数与每条目标注者数的权衡,发现常用的每条目 1、3、5 名标注者往往不足,可靠结果常需超过 10 名。
Google Quantum AI 发布白皮书,称未来量子计算机破解加密货币所依赖的 ECDLP-256 所需的物理量子比特比此前估计少约 20 倍。
推荐理由:Google 用量子资源估算与零知识证明披露方式,给出区块链迁移 PQC 的时间压力与路径参考。
Google DeepMind 发布关于 AI 有害操纵的新研究,称其构建了首个经实证验证的工具包,用于在真实场景中测量这类 AI 操纵,并公开了开展同类人类参与者研究所需的全部材料。
Google 发布 TurboQuant 压缩算法,可将 KV cache 量化到 3 bit,无需训练或微调且不损失模型精度,相关论文将亮相 ICLR 2026。
推荐理由:Google 公布 TurboQuant 等三种向量量化算法,读者可了解 KV cache 压缩到 3 bit 且不损失精度的实现路径。
Google Research 推出自监督框架 S2Vec,将建筑环境栅格化为多层特征图像,用掩码自编码(MAE)学习通用嵌入向量,无需人工标注即可刻画任意地点的特征。在 US-wide 人口密度、收入中位数等社会经济指标的零样本地理外推任务上,S2Vec 通常是表现最好的单一模型,与图像嵌入做多模态融合后效果普遍优于任一单模态。在树木覆盖、海拔等环境任务上仍有明显改进空间。
Google Research 与多家 NHS 机构合作的 AIMS 研究在 Nature Cancer 发表两项姊妹研究,评估 AI 乳腺筛查系统。
推荐理由:两项 Nature Cancer 研究给出了 AI 在 NHS 乳腺筛查中的前瞻部署数据与人工仲裁交互结果,可了解落地时的数据漂移与仲裁量问题。
Google DeepMind 发布论文《Measuring Progress Toward AGI: A Cognitive Taxonomy》,提出涵盖感知。
Google 与康奈尔大学合作在 PNAS 发表研究,让 GPT-4o、Perplexity、Claude 3.5、Gemini Advanced Pro 1.5、NotebookLM 和自建 RAG 系统共 6 个 LLM 回答 67 道高温超导专家级问题,由国际专家小组按 6 项指标盲评打分。
伯克利 AI 研究团队提出 SPEX 与 ProxySPEX 算法,可在特征、数据和模型组件归因中大规模识别关键交互。SPEX 利用稀疏性与低阶性将交互搜索转化为稀疏恢复问题,ProxySPEX 进一步借助层级结构,以约少 10 倍的消融次数达到 SPEX 的性能。在情感分析任务上,SPEX 在上下文扩展至数千特征时仍保持高忠实度,优于 LIME、Banzhaf 等边际方法。
Google Research 与 Beth Israel Deaconess Medical Center 合作开展前瞻性单中心可行性研究,让 AMIE 在门诊初诊前与患者进行文本问诊,全程由医生通过视频监督。
推荐理由:Google 与 BIDMC 的这项前瞻性研究给出了 AMIE 在真实门诊中零安全中止、诊断与基层医生相当的具体数据,可了解对话式医疗 AI 落地临床的可行性与边界。
OpenAI 推出 IH-Challenge,用于训练模型优先执行可信指令,提升指令层级、安全可控性以及对提示词注入攻击的抵抗力。
Google Research 发布 WAXAL,一个覆盖 27 种撒哈拉以南非洲语言、服务超 1 亿使用者的开放语音数据集,采用 CC-BY-4.0 许可。该数据集包含约 1,846 小时 ASR 转写语音和超 565 小时 TTS 高保真录音,由非洲学术与社区机构主导采集,2021 年起历时多年完成。
OpenAI 提出 CoT-Control,发现推理模型难以控制自己的思维链,这一结果支持将可监控性作为 AI 安全防护手段。材料仅提供摘要,未给出具体模型、评测指标或实验细节。
推荐理由:OpenAI 提出 CoT-Control 并给出推理模型难以控制思维链的观察,为可监控性作为安全手段提供了依据。
Google Research 提出"贝叶斯教学"方法,通过监督微调让 LLM 模仿贝叶斯助手在航班推荐任务中的预测,从而学会概率推理。在五轮模拟用户交互中,未经训练的 LLM 表现明显逊于最优贝叶斯助手,且往往在单次交互后性能就停滞,难以随新信息持续更新;而贝叶斯教学不仅提升该任务表现,还能泛化到其他任务。
OpenAI 发布新预印本,将单负振幅扩展至引力子,GPT-5.2 Pro 参与推导并验证了量子引力中非零的引力子树振幅。
OpenAI 分享了其 AI 模型针对 First Proof 数学挑战的证明尝试,用于测试模型在专家级问题上的研究级推理能力。
IBM Research 与 UC Berkeley 用 MAST 失败分类法分析 ITBench 中 310 条 SRE 执行轨迹,覆盖 Gemini-3-Flash、Kimi-K2 和 GPT-OSS-120B 三类模型。
Google Research 提出 MapTrace,用 Gemini 2.5 Pro 与 Imagen-4 构建全自动合成数据管线,生成 200 万条带路径标注的地图问答对并已开源。该管线经地图生成、Mask Critic 筛选可通行区域、构建像素图、Dijkstra 求最短路加 Path Critic 校验四步,在 23,000 条路径上微调多个 MLLM 以提升细粒度空间推理能力。
OpenAI 发布新预印本,显示 GPT-5.2 为一个胶子振幅提出了新公式,随后由 OpenAI 与学术合作者正式证明并验证。该结果以预印本形式公开。
推荐理由:OpenAI 与学术合作者披露 GPT-5.2 提出胶子振幅新公式并被形式化证明,可观察大模型参与理论物理推导的路径。
Hugging Face 博客介绍 Meta 与 Hugging Face 合作的开源框架 OpenEnv,它用 gym 风格 API(reset、step、action、observations)和标准 MCP 工具调用接口,把智能体接到浏览器、代码仓库、日历等真实系统而非模拟环境中评测。
推荐理由:Meta 与 Hugging Face 的 OpenEnv 框架及 Turing 的 Calendar Gym 给出了智能体在真实权限与多步环境下的失败模式数据。
Google Research 在 ACM UIST 2025 发布开源原型框架 DialogLab,用于编写、模拟和测试动态的人-AI 群组对话,将对话的社交设定与时间推进解耦,支持拖拽式场景搭建、实时预览与验证仪表盘。14 名游戏设计、教育和社会科学领域参与者的评测显示,human control 模式在参与度、有效性和真实感上显著优于 autonomous 与 reactive 模式。
Google Research 与 Google DeepMind 发现,主要用鸟类等陆生动物音频训练的 Perch 2.0 生物声学基础模型,在未接触任何水下音频的情况下,仍能作为嵌入模型有效迁移到海洋任务,用于区分须鲸物种和虎鲸生态型。
Google DeepMind 发布两篇论文,介绍在数学家、物理学家和计算机科学家指导下,用 Gemini Deep Think 模式解决数学、物理与计算机科学领域的专业研究问题。
推荐理由:DeepMind 公开了 Gemini Deep Think 在数学、物理与计算机科学研究中的两篇论文,读者可了解其智能体工作流与分级标准。
Google Research 提出 Sequential Attention,用贪心选择机制在单次训练中顺序、自适应地挑选最佳组件,把子集选择直接整合进模型训练,避免传统贪心算法带来的数量级训练开销。该方法在多个神经网络基准上取得 SOTA,并实现快速单遍贪心选择,可用于特征选择、嵌入维度调优和权重剪枝,兼顾效率、精度、可解释性与可扩展性。
Google Research 发布论文《Towards a Science of Scaling Agent Systems》,对 180 种智能体配置做大规模对照评测,覆盖 Finance-Agent、BrowseComp-Plus、PlanCraft、Workbench 四个基准和 GPT、Gemini、Claude 三个模型家族。
推荐理由:通过 180 种智能体配置的对照实验,给出多智能体架构在并行与串行任务上的量化差异,可据此调整编排策略。
Google Research 提出 ATLAS 多语言缩放定律,基于 774 次训练运行、10M–8B 参数模型、400+ 语言数据,可指导模型规模与语言配比选择。其跨语言迁移矩阵显示,支持语言数翻倍时模型规模需增至 1.18 倍、数据量增至 1.66 倍。该研究将发表于 ICLR 2026。
Hugging Face 团队推出 Alyah(阿联酋方言中意为"北极星")基准,用于评估阿拉伯语 LLM 对阿联酋方言的语言、文化与语用理解能力。该基准包含 1,173 个由阿联酋母语者手工收集的多选题样本,覆盖问候语、诗歌、 heritage 知识等七类内容。
Google 在 NeurIPS 2025 提出 GIST(Greedy Independent Set Thresholding)算法,用于训练数据子集选择,在多样性与效用之间取得平衡。GIST 是首个为该权衡提供可证明保证的算法,保证所选子集价值至少为最优解的一半,并在图像分类等基准任务上超越现有方法。
Google Research 在 EMNLP 2025 发表的论文提出一种分解式方法,将用户意图理解拆为两步:先用小型多模态 LLM 逐屏总结交互,再从摘要序列中提取意图。在移动端和网页轨迹上,该方法优于 CoT 提示和端到端微调,Gemini 1.5 Flash 8B 配合该方法的意图提取效果可与 Gemini 1.5 Pro 相当,成本与速度仅为后者一小部分。
Hugging Face 发布 AssetOpsBench,一个面向工业资产运维的智能体评测基准,包含 2.3M 传感器遥测点、140+ 场景、4.2K 工单和 53 种结构化故障模式,覆盖 4 个智能体。
微软发布 Differential Transformer V2(DIFF V2),通过将查询头数翻倍、保持 KV 头数不变,使解码速度与标准 Transformer 持平,且无需自定义注意力 kernel。
Google Research 提出一种基于时序卷积网络(TCN)的多头深度学习模型,仅用单只 Pixel Watch 的 IMU 信号(50 Hz 三轴加速度计与陀螺仪)加用户身高,即可直接估算步速、步长、摆动时间、支撑时间和双脚支撑时间等步态指标。
Google Research 在 Science Advances 发表论文,介绍 NeuralGCM 直接使用 2001 至 2018 年 NASA 卫星降水观测训练其机器学习部分,而非依赖再分析数据。
推荐理由:NeuralGCM 改用卫星降水观测训练后,在 15 天预报与数十年气候模拟中对比 ECMWF 等模型的误差变化值得关注。
Berkeley AI Research 提出一种基于互信息的成像系统评估与优化框架,可直接从含噪测量中估计信息量,预测系统性能。该方法在彩色摄影、射电天文、无透镜成像和显微镜四个领域验证有效,优化后的设计达到端到端方法水平,且内存和计算需求更低、无需任务专用解码器。相关成果发表于 NeurIPS 2025 论文。