NVIDIA Nemotron 3 Nano 30B A3B 如何用 NeMo Evaluator 实现开放评测
NVIDIA 发布 Nemotron 3 Nano 30B A3B,并公开其完整评测配方,基于开源库 NeMo Evaluator 构建,任何人可复现评测流程并独立核查结果。
NVIDIA 发布 Nemotron 3 Nano 30B A3B,并公开其完整评测配方,基于开源库 NeMo Evaluator 构建,任何人可复现评测流程并独立核查结果。
OpenAI 发布 GPT-5.2,称其为目前数学与科学能力最强的模型,在 GPQA Diamond 和 FrontierMath 等基准上取得新的 SOTA 结果。官方表示这些提升已转化为实际研究进展,包括解决一个开放理论问题并生成可靠的数学证明。
推荐理由:原文给出 GPT-5.2 在 GPQA Diamond 与 FrontierMath 上的新结果,读者可据此了解其在数学与科研任务上的能力边界。
Hugging Face 发布教程,展示如何让 OpenAI Codex 借助 Hugging Face Skills 仓库完成端到端模型微调实验。
推荐理由:原文给出可复用的 HF-skills 配置与端到端微调流程,读者可据此把训练实验交给编码智能体执行。
Google Research 在 COLM 2025 论文中提出 Urania 框架,通过 DP 聚类与 DP 关键词提取,从 LLM 聊天记录中生成带端到端差分隐私保证的使用洞察。该框架让 LLM 只基于匿名关键词生成摘要,不接触原始对话,从而抵御提示注入等泄露风险。评测中 DP 摘要被 LLM 评审偏好的比例最高达 70%,但隐私预算收紧会降低主题覆盖度。
Google DeepMind 宣布深化与英国政府的合作,聚焦用 AI 加速科学发现、教育、公共服务现代化及国家安全。合作将向英国科学家优先开放 AlphaEvolve、AlphaGenome、AI co-scientist 和 WeatherNext 等"AI for Science"模型,并于 2026 年在英国建立其首个自动化材料科学实验室。
Google DeepMind 联合 Kaggle 发布 FACTS Benchmark Suite,在原有 FACTS Grounding 基础上新增 Parametric、Search、Multimodal 三项基准,并将 Grounding 升级至 v2,共 3,513 个公开样例。
OpenAI 的企业数据显示,2025 年各行业 AI 采用正在加速、集成程度加深,并带来可衡量的生产力提升。
Google Research 发布 Titans 架构与 MIRAS 理论框架,将深度神经网络作为长期记忆模块,结合 RNN 的速度与 Transformer 的精度。
推荐理由:Google Research 提出 Titans 架构与 MIRAS 框架,用深度神经网络做长期记忆模块,读者可了解长上下文建模的新思路。
密歇根州立大学 Berkley Walker 团队借助 AlphaFold 预测植物与嗜热藻类中光合作用关键酶 GLYK 的 3D 结构,发现植物版 GLYK 的三个柔性环在高温下变形失稳。研究人员据此用藻类 GLYK 中更刚性的环替换植物版的不稳定环,构建出杂合酶,其中一种在高达 65 °C 下仍保持稳定。
Intel AI Software Group 推出 DeepMath,一个基于 Qwen3-4B Thinking 并用 GRPO 微调的数学推理 Agent,通过 smolagents 实现,让模型生成 Python 片段在沙箱中执行并回填结果。
Hugging Face 发布 Hugging Face Skills,其中 hf-llm-trainer 技能让 Claude Code、Codex、Gemini CLI 等编码智能体直接提交云端 GPU 训练任务、监控进度并把模型推送到 Hub。
推荐理由:原文给出 hf-llm-trainer 技能的安装命令与完整训练流程,读者可据此让编码智能体代跑微调任务。
Google Research 在 NeurIPS 2025 发布 Massive Sound Embedding Benchmark(MSEB),用统一框架评估声音嵌入在检索、推理、分类、转录、分割、聚类、重排、重建八项任务上的表现。
OpenAI 宣布收购 Neptune,以更深入地观察模型行为,并强化研究人员用于追踪实验和监控训练的工具。
推荐理由:OpenAI 收购 Neptune 的官方说明,交代了它在模型行为追踪与训练监控上的用途。
Hugging Face 发布 Transformers v5.0.0rc-0,距 v4 首个候选版已五年,如今该库每天通过 pip 安装超过 300 万次,累计安装量超过 12 亿次。
推荐理由:官方梳理了 v5 在模型定义、训练、推理与量化上的取舍,可据此判断现有工作流是否需要迁移。
AlphaFold 2 自 2020 年在 CASP 14 上解决蛋白质结构预测难题以来,已向全球 190 多个国家的超 300 万研究人员免费开放 AlphaFold Protein Database,累计预测超 2 亿个蛋白质结构。
Google DeepMind 发布博文介绍,密苏里大学研究人员借助 AlphaFold 与冷冻电镜(cryo-EM)数据,解析出“坏胆固醇”关键蛋白 apoB100 的结构。
推荐理由:AlphaFold 预测与冷冻电镜数据结合解析 apoB100 结构,展示了 AI 在结构生物学中的具体用法。
Google DeepMind 宣布支持白宫 Genesis Mission,并与美国能源部合作,向 DOE 全部 17 个国家实验室提供前沿 AI for Science 模型和智能体工具的加速访问计划,首批上线的是基于 Gemini 的 AI co-scientist。
推荐理由:Google DeepMind 与 DOE 的合作给出了 AI for Science 从模型到国家实验室落地的具体路径,可观察前沿模型在科研场景的接入方式。
Google 设计了一个基于线性回归的轻量模型,预测某充电站在未来若干分钟后仍有空闲充电桩的概率,用于将充电站纳入 EV 导航路线以缓解续航焦虑。该模型仅以一天中的小时作为特征,在 30 至 60 分钟预测窗口、至少 6 个充电桩的站点上,表现优于"保持当前状态"这一强基线,主要靠识别高占用周转的少数关键时刻。
Hugging Face TRL 正式集成 RapidFire AI,用户可并发运行多个微调与后训练配置并近乎实时比较结果。RapidFire AI 通过自适应分块调度在单张 GPU 上同时跑多个配置,官方基准显示达到同等最佳训练 loss 的时间相比顺序比较提速 15 至 20 倍,并支持 SFT、DPO、GRPO 的 drop-in 配置与 MLflow 仪表盘上的停止、克隆、修改等操作。
ServiceNow 的 SLAM Lab 发布 Apriel-H1,把 15B 推理模型改造成 Mamba 混合架构,旗舰版 Apriel-H1-15b-Thinker-SFT 实现 2.1 倍吞吐且质量损失很小,MATH500 从 0.90 升到 0.92、MTBench 从 8.30 升到 8.58,GSM8k、GPQA、AIME24 略有下降。
推荐理由:ServiceNow 公开了把 15B 推理模型蒸馏成 Mamba 混合架构的完整流程与七个 checkpoint,可看到效率与质量的取舍曲线。
Google DeepMind 与 Google Research 发布天气预报模型 WeatherNext 2,生成预报速度提升 8 倍,分辨率最高可达 1 小时。
推荐理由:官方给出 WeatherNext 2 的提速幅度、分辨率与开放入口,可据此判断 AI 天气预报的可用边界。
Google DeepMind 联合 Google Research 发布 Natural Forests of the World 2020,这是首个全球一致、10 米分辨率的天然林地图与数据集,在独立全球数据集上验证准确率达 92.2%。
Google Quantum AI 联合斯坦福、MIT、Caltech 在 Nature 发表论文,提出量子算法 Decoded Quantum Interferometry(DQI),利用量子干涉将优化问题转化为解码问题求解。
Google 发布 JAX-Privacy 1.0,这是构建在 JAX 之上、用于大规模机器学习差分隐私训练的模块化工具库。新版本集成最新 DP 算法研究成果,支持 DP-SGD、DP-FTRL 及 DP matrix factorization 等方法,并借助 JAX 的 vmap、shard_map 实现数据与模型并行,可在多加速器和超算上训练大模型。
Google DeepMind 在 Nature 发表新论文,提出三步对齐方法,将视觉模型的内部表征重组得更接近人类认知。研究基于 THINGS 数据集训练 SigLIP-SO400M 适配器作为教师模型,生成含百万张图像、数百万条类人判断的 AligNet 数据集,再微调学生模型。对齐后模型表征按人类概念层级结构化,鲁棒性与泛化能力提升。
Google Research 在 NeurIPS 2025 论文中提出 Nested Learning,将模型架构与优化算法统一视为多层嵌套的优化问题,每层拥有各自的 context flow 和更新频率,以缓解灾难性遗忘。
Google 推出数据科学智能体 DS-STAR,通过数据文件分析、LLM 评判验证与顺序规划迭代三项创新,在 DABStep、KramaBench、DA-Code 上超越 AutoGen 和 DA-Agent,准确率分别从 41.0% 提升至 45.2%、39.8% 提升至 44.7%、37.0% 提升至 38.5%。
Google 发布三项生物圈研究成果:与 World Resources Institute 合作推出森林砍伐风险预测基准数据集,基于纯卫星输入和 vision transformer 架构,可在 30 米尺度上预测风险。
Google 发布 ForestCast,一个基于纯卫星数据与视觉 Transformer 的深度学习模型,用于预测森林砍伐风险,并同步公开首个面向该任务的基准数据集。
Google 公布研究项目 Project Suncatcher,设想由太阳能卫星组成星座、搭载 Google TPU 并通过自由空间光链路互联,以在太空扩展 AI 算力。
推荐理由:Google 公开了太空 AI 基础设施的预印本,给出卫星互联、轨道与 TPU 抗辐射的实测数据,可了解这一设想的技术边界。
Google Research 在 Research@MTV 活动上公布三项最新突破:Google Earth AI、DeepSomatic 与 Quantum Echoes。
Google 发布首个可证明隐私洞察(PPI)系统,结合 LLM、差分隐私(DP)与可信执行环境(TEE),分析非结构化的 GenAI 使用数据,保证个体数据不可被查看、聚合洞察匿名。
MiniMax 披露 M2 后训练中的智能体对齐经验:智能体需要交错思考(Interleaved Thinking),在任务全程而非开头一次性推理,以应对长上下文和工具输出带来的扰动。
Hugging Face 发布分析文章,指出中国开源权重模型的推理已开始由华为昇腾、寒武纪等国产芯片承载,部分模型开始用国产芯片训练。文章认为美国出口管制与中国芯片产能提速高度相关,芯片稀缺也促使 DeepSeek 的 MLA、GRPO 等算力效率创新走向开源。
推荐理由:梳理中国算力从被限制到自建全栈的路径,帮助读者理解开源模型与国产芯片如何互相推动。
Hugging Face 发布 datasets 与 huggingface_hub 的流式加载改进,load_dataset(streaming=True) 接口保持不变即可获得性能提升。
推荐理由:官方给出流式加载的请求量、解析速度与吞吐变化,可据此判断大规模训练的数据管线是否值得切换。
Sentence Transformers 从 TU Darmstadt 的 UKP Lab 转由 Hugging Face 维护,Hugging Face 的 Tom Aarsen 自 2023 年底起已负责该项目并将继续领导。
Hugging Face 发起 AI for Food Allergies 项目,计划打造首个社区驱动的研究实验室,探索 AI 如何推进食物过敏研究。全球约 2.2 亿人患有至少一种食物过敏,美国约占总人口 10%。项目将连接前沿 AI 与生物医学,开发开放协作项目,服务研究者、临床医生与患者。
NVIDIA 发布 Nemotron-Personas-India,首个对齐印度真实人口、地理与文化分布的开放合成 Indic 人设数据集,采用 CC BY 4.0 许可。
三星与 SK 加入 OpenAI 的 Stargate 计划,以扩展全球 AI 基础设施。双方将扩大先进存储芯片生产,并在韩国建设下一代数据中心。
Hugging Face 发布 Retrieval Embedding Benchmark(RTEB)beta 版,用公开与私有数据集混合的方式评测嵌入模型的真实检索泛化能力。该基准覆盖 20 种语言,聚焦法律、医疗、代码、金融等企业领域,默认榜单指标为 NDCG@10,私有数据集由 MTEB 维护者评测,单个数据集至少含 1k 文档和 50 条查询。