Google 研究:用鸟类数据训练的 Perch 2.0 如何揭示水下鲸类之谜
Google Research 与 Google DeepMind 发现,主要用鸟类等陆生动物音频训练的 Perch 2.0 生物声学基础模型,在未接触任何水下音频的情况下,仍能作为嵌入模型有效迁移到海洋任务,用于区分须鲸物种和虎鲸生态型。
Google Research 与 Google DeepMind 发现,主要用鸟类等陆生动物音频训练的 Perch 2.0 生物声学基础模型,在未接触任何水下音频的情况下,仍能作为嵌入模型有效迁移到海洋任务,用于区分须鲸物种和虎鲸生态型。
Hugging Face 发布 SyGra 2.0.0 的 Studio,把合成数据生成搬到画布上,可视化编排流程并自动生成 SyGra 兼容的图配置与任务执行脚本。
OpenAI 的 GPT-5 与 Ginkgo Bioworks 的云端自动化结合组成自主实验室,通过闭环实验将无细胞蛋白质合成成本降低 40%。
Google Research 提出 Sequential Attention,用贪心选择机制在单次训练中顺序、自适应地挑选最佳组件,把子集选择直接整合进模型训练,避免传统贪心算法带来的数量级训练开销。该方法在多个神经网络基准上取得 SOTA,并实现快速单遍贪心选择,可用于特征选择、嵌入维度调优和权重剪枝,兼顾效率、精度、可解释性与可扩展性。
Hugging Face 公布 PRX 文本到图像模型训练消融实验,以 1.2B 参数 PRX-1.2B 为基线,在 Flux VAE latent 空间、256×256 分辨率、全局 batch size 256 下训练 100k 步。
OpenAI 构建了一个内部 AI 数据智能体,结合 GPT-5、Codex 和记忆能力对海量数据集进行推理,可在数分钟内给出可靠洞察。
Google Research 发布论文《Towards a Science of Scaling Agent Systems》,对 180 种智能体配置做大规模对照评测,覆盖 Finance-Agent、BrowseComp-Plus、PlanCraft、Workbench 四个基准和 GPT、Gemini、Claude 三个模型家族。
推荐理由:通过 180 种智能体配置的对照实验,给出多智能体架构在并行与串行任务上的量化差异,可据此调整编排策略。
Google Research 提出 ATLAS 多语言缩放定律,基于 774 次训练运行、10M–8B 参数模型、400+ 语言数据,可指导模型规模与语言配比选择。其跨语言迁移矩阵显示,支持语言数翻倍时模型规模需增至 1.18 倍、数据量增至 1.66 倍。该研究将发表于 ICLR 2026。
中国开源模型社区已近乎一致转向 MoE 架构,Kimi K2、MiniMax M2、Qwen3 均采用该路线,以在成本约束下兼顾能力与灵活部署。开源活动从文本扩展到多模态与智能体,StepFun 的 Step-Audio-R1.1 语音模型性能超越闭源模型,腾讯开源 Hunyuan Video 与 Hunyuan 3D。
Hugging Face 团队推出 Alyah(阿联酋方言中意为"北极星")基准,用于评估阿拉伯语 LLM 对阿联酋方言的语言、文化与语用理解能力。该基准包含 1,173 个由阿联酋母语者手工收集的多选题样本,覆盖问候语、诗歌、 heritage 知识等七类内容。
Google 在 NeurIPS 2025 提出 GIST(Greedy Independent Set Thresholding)算法,用于训练数据子集选择,在多样性与效用之间取得平衡。GIST 是首个为该权衡提供可证明保证的算法,保证所选子集价值至少为最优解的一半,并在图像分类等基准任务上超越现有方法。
Hugging Face 发布 AssetOpsBench,一个面向工业资产运维的智能体评测基准,包含 2.3M 传感器遥测点、140+ 场景、4.2K 工单和 53 种结构化故障模式,覆盖 4 个智能体。
微软发布 Differential Transformer V2(DIFF V2),通过将查询头数翻倍、保持 KV 头数不变,使解码速度与标准 Transformer 持平,且无需自定义注意力 kernel。
Google Research 提出一种基于时序卷积网络(TCN)的多头深度学习模型,仅用单只 Pixel Watch 的 IMU 信号(50 Hz 三轴加速度计与陀螺仪)加用户身高,即可直接估算步速、步长、摆动时间、支撑时间和双脚支撑时间等步态指标。
Google 发布 MedGemma 1.5 4B,新增对 CT、MRI 和全切片病理等高维医学影像的支持,并同步推出医疗听写语音识别模型 MedASR。
推荐理由:原文给出 MedGemma 1.5 与 MedASR 的基准提升和开放下载入口,读者可据此判断医疗多模态模型的可用边界。
Google Research 在 Science Advances 发表论文,介绍 NeuralGCM 直接使用 2001 至 2018 年 NASA 卫星降水观测训练其机器学习部分,而非依赖再分析数据。
推荐理由:NeuralGCM 改用卫星降水观测训练后,在 15 天预报与数十年气候模拟中对比 ECMWF 等模型的误差变化值得关注。
Berkeley AI Research 提出一种基于互信息的成像系统评估与优化框架,可直接从含噪测量中估计信息量,预测系统性能。该方法在彩色摄影、射电天文、无透镜成像和显微镜四个领域验证有效,优化后的设计达到端到端方法水平,且内存和计算需求更低、无需任务专用解码器。相关成果发表于 NeurIPS 2025 论文。
Hugging Face 发布 Falcon-H1-Arabic 阿拉伯语模型家族,含 3B、7B、34B 三个规模,采用 Mamba 与 Transformer 注意力并行的 Falcon-H1 混合架构。
Transformers v5 重新设计了 tokenizer 的工作方式,将 tokenizer 架构与训练好的词表分离,类似 PyTorch 把网络结构与学习到的权重分开。新设计带来更清晰的内部结构、干净的类层级和单一快速后端,让 tokenizer 可检查、可定制、可从零训练。
NVIDIA 发布 Nemotron 3 Nano 30B A3B,并公开其完整评测配方,基于开源库 NeMo Evaluator 构建,任何人可复现评测流程并独立核查结果。
OpenAI 发布 GPT-5.2,称其为目前数学与科学能力最强的模型,在 GPQA Diamond 和 FrontierMath 等基准上取得新的 SOTA 结果。官方表示这些提升已转化为实际研究进展,包括解决一个开放理论问题并生成可靠的数学证明。
推荐理由:原文给出 GPT-5.2 在 GPQA Diamond 与 FrontierMath 上的新结果,读者可据此了解其在数学与科研任务上的能力边界。
Hugging Face 发布教程,展示如何让 OpenAI Codex 借助 Hugging Face Skills 仓库完成端到端模型微调实验。
推荐理由:原文给出可复用的 HF-skills 配置与端到端微调流程,读者可据此把训练实验交给编码智能体执行。
Google Research 在 COLM 2025 论文中提出 Urania 框架,通过 DP 聚类与 DP 关键词提取,从 LLM 聊天记录中生成带端到端差分隐私保证的使用洞察。该框架让 LLM 只基于匿名关键词生成摘要,不接触原始对话,从而抵御提示注入等泄露风险。评测中 DP 摘要被 LLM 评审偏好的比例最高达 70%,但隐私预算收紧会降低主题覆盖度。
Google DeepMind 宣布深化与英国政府的合作,聚焦用 AI 加速科学发现、教育、公共服务现代化及国家安全。合作将向英国科学家优先开放 AlphaEvolve、AlphaGenome、AI co-scientist 和 WeatherNext 等"AI for Science"模型,并于 2026 年在英国建立其首个自动化材料科学实验室。
Google DeepMind 联合 Kaggle 发布 FACTS Benchmark Suite,在原有 FACTS Grounding 基础上新增 Parametric、Search、Multimodal 三项基准,并将 Grounding 升级至 v2,共 3,513 个公开样例。
OpenAI 的企业数据显示,2025 年各行业 AI 采用正在加速、集成程度加深,并带来可衡量的生产力提升。
Google Research 发布 Titans 架构与 MIRAS 理论框架,将深度神经网络作为长期记忆模块,结合 RNN 的速度与 Transformer 的精度。
推荐理由:Google Research 提出 Titans 架构与 MIRAS 框架,用深度神经网络做长期记忆模块,读者可了解长上下文建模的新思路。
密歇根州立大学 Berkley Walker 团队借助 AlphaFold 预测植物与嗜热藻类中光合作用关键酶 GLYK 的 3D 结构,发现植物版 GLYK 的三个柔性环在高温下变形失稳。研究人员据此用藻类 GLYK 中更刚性的环替换植物版的不稳定环,构建出杂合酶,其中一种在高达 65 °C 下仍保持稳定。
Intel AI Software Group 推出 DeepMath,一个基于 Qwen3-4B Thinking 并用 GRPO 微调的数学推理 Agent,通过 smolagents 实现,让模型生成 Python 片段在沙箱中执行并回填结果。
Hugging Face 发布 Hugging Face Skills,其中 hf-llm-trainer 技能让 Claude Code、Codex、Gemini CLI 等编码智能体直接提交云端 GPU 训练任务、监控进度并把模型推送到 Hub。
推荐理由:原文给出 hf-llm-trainer 技能的安装命令与完整训练流程,读者可据此让编码智能体代跑微调任务。
Google Research 在 NeurIPS 2025 发布 Massive Sound Embedding Benchmark(MSEB),用统一框架评估声音嵌入在检索、推理、分类、转录、分割、聚类、重排、重建八项任务上的表现。
OpenAI 宣布收购 Neptune,以更深入地观察模型行为,并强化研究人员用于追踪实验和监控训练的工具。
推荐理由:OpenAI 收购 Neptune 的官方说明,交代了它在模型行为追踪与训练监控上的用途。
Hugging Face 发布 Transformers v5.0.0rc-0,距 v4 首个候选版已五年,如今该库每天通过 pip 安装超过 300 万次,累计安装量超过 12 亿次。
推荐理由:官方梳理了 v5 在模型定义、训练、推理与量化上的取舍,可据此判断现有工作流是否需要迁移。
AlphaFold 2 自 2020 年在 CASP 14 上解决蛋白质结构预测难题以来,已向全球 190 多个国家的超 300 万研究人员免费开放 AlphaFold Protein Database,累计预测超 2 亿个蛋白质结构。
Google DeepMind 发布博文介绍,密苏里大学研究人员借助 AlphaFold 与冷冻电镜(cryo-EM)数据,解析出“坏胆固醇”关键蛋白 apoB100 的结构。
推荐理由:AlphaFold 预测与冷冻电镜数据结合解析 apoB100 结构,展示了 AI 在结构生物学中的具体用法。
Google DeepMind 宣布支持白宫 Genesis Mission,并与美国能源部合作,向 DOE 全部 17 个国家实验室提供前沿 AI for Science 模型和智能体工具的加速访问计划,首批上线的是基于 Gemini 的 AI co-scientist。
推荐理由:Google DeepMind 与 DOE 的合作给出了 AI for Science 从模型到国家实验室落地的具体路径,可观察前沿模型在科研场景的接入方式。
Google 设计了一个基于线性回归的轻量模型,预测某充电站在未来若干分钟后仍有空闲充电桩的概率,用于将充电站纳入 EV 导航路线以缓解续航焦虑。该模型仅以一天中的小时作为特征,在 30 至 60 分钟预测窗口、至少 6 个充电桩的站点上,表现优于"保持当前状态"这一强基线,主要靠识别高占用周转的少数关键时刻。
Hugging Face TRL 正式集成 RapidFire AI,用户可并发运行多个微调与后训练配置并近乎实时比较结果。RapidFire AI 通过自适应分块调度在单张 GPU 上同时跑多个配置,官方基准显示达到同等最佳训练 loss 的时间相比顺序比较提速 15 至 20 倍,并支持 SFT、DPO、GRPO 的 drop-in 配置与 MLflow 仪表盘上的停止、克隆、修改等操作。
ServiceNow 的 SLAM Lab 发布 Apriel-H1,把 15B 推理模型改造成 Mamba 混合架构,旗舰版 Apriel-H1-15b-Thinker-SFT 实现 2.1 倍吞吐且质量损失很小,MATH500 从 0.90 升到 0.92、MTBench 从 8.30 升到 8.58,GSM8k、GPQA、AIME24 略有下降。
推荐理由:ServiceNow 公开了把 15B 推理模型蒸馏成 Mamba 混合架构的完整流程与七个 checkpoint,可看到效率与质量的取舍曲线。
Google DeepMind 与 Google Research 发布天气预报模型 WeatherNext 2,生成预报速度提升 8 倍,分辨率最高可达 1 小时。
推荐理由:官方给出 WeatherNext 2 的提速幅度、分辨率与开放入口,可据此判断 AI 天气预报的可用边界。