OpenAI 与 Molecule.one 用 GPT-5.4 打造近自主 AI 化学家,改进药物化学中的难反应
OpenAI 与 Molecule.one 展示了一个由 GPT-5.4 驱动的近自主 AI 化学家,它改进了一项关键的制药反应,推进了药物化学研究。
推荐理由:OpenAI 与 Molecule.one 用 GPT-5.4 驱动的近自主 AI 化学家改进药物合成反应,可了解 AI 在实验科学中的落地方式。
训练侧的门道:数据集构建、合成数据、预训练与后训练方法、算力与训练成本。
OpenAI 与 Molecule.one 展示了一个由 GPT-5.4 驱动的近自主 AI 化学家,它改进了一项关键的制药反应,推进了药物化学研究。
推荐理由:OpenAI 与 Molecule.one 用 GPT-5.4 驱动的近自主 AI 化学家改进药物合成反应,可了解 AI 在实验科学中的落地方式。
Google DeepMind 公布在塞拉利昂开展的预注册试验结果,使用 Guided Learning 的学生数学成绩比对照组提升 0.258 个标准差,约相当于八周内取得 1.2 至 1.7 年的常规学习进度。
推荐理由:原文给出塞拉利昂预注册试验的量化结果与交互数据,读者可据此了解AI辅助教学的实际效果与局限。
OpenAI 为 GPT-Rosalind 推出新能力,面向生命科学研究,增强生物推理、药物化学专长、基因组分析与实验工作流能力。
推荐理由:OpenAI 公布 GPT-Rosalind 在生物推理、药物化学与基因组分析上的能力扩展,读者可据此了解该模型在生命科学场景的定位。
Hugging Face 在 TRL 中落地了增量权重同步(Delta Weight Sync):只把两次 RL 优化步之间真正变化的 bf16 权重编码成稀疏 safetensors 文件,上传到 Hugging Face Bucket,再由 vLLM 拉取应用。
推荐理由:TRL 的稀疏增量权重同步把异步 RL 每步传输量压到原来的百分之几,读者可据此判断跨集群训练的成本边界。
Google 在 Nature 发表论文介绍 Empirical Research Assistance(ERA),这是一个用 Gemini 编写和优化科学代码的研究工具,通过树搜索在数千种方案中迭代优化代码。
推荐理由:Google 用 Gemini 驱动的 ERA 在 Nature 发表,并给出流行病、径流、CO2 等八篇应用结果,可看科研编码自动化的边界。
Google DeepMind 发布 Gemini for Science,包含 Google Labs 上三个实验性工具和 Google Antigravity 中的 Science Skills。
推荐理由:原文给出三类科学实验工具的能力分工与开放入口,可据此判断智能体在科研流程中的落点。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,这是一个基于 Gemini 构建的多智能体 AI 系统,可迭代生成、辩论和演化复杂科学问题的新假设。
推荐理由:原文披露了多智能体系统的三阶段协作机制与跨机构验证案例,可了解AI参与科学假设生成的具体路径。
Google DeepMind 回顾了 Gemini 驱动的编码智能体 AlphaEvolve 发布一年来的应用进展,称其已从试点成为 Google 基础设施的核心组件,用于优化下一代 TPU 设计和缓存替换策略。
推荐理由:原文汇总了 AlphaEvolve 在基因组、电网、量子物理和商业客户中的落地数据,可据此判断编码智能体的跨领域适用范围。
Google Research 介绍了科学家使用 Empirical Research Assistance(ERA)开展科研的四个方向:公共卫生、宇宙学、气候与神经科学。
推荐理由:Google Research 用四个真实科研项目展示 ERA 在流行病预测、宇宙学、卫星 CO2 监测和神经回路发现中的具体产出。
IBM Granite 团队发布技术文章,详解 Granite 4.1 系列稠密 LLM(3B、8B、30B)的训练流程:约 15T tokens 五阶段预训练,上下文窗口经长上下文扩展至 512K tokens,随后用约 4.1M 条高质量样本做 SFT,并采用 on-policy GRPO 配合 DAPO loss 的多阶段强化学习。
推荐理由:Granite 4.1 团队公开了从数据配比到多阶段 RL 的完整训练细节,可对照其 8B 稠密模型追平 32B MoE 的结论。
Google DeepMind 发布论文提出 Decoupled DiLoCo 分布式训练架构,将训练拆分为解耦的计算“岛屿”,岛屿间异步传输数据,从而隔离局部硬件故障。
推荐理由:原文给出分布式训练新架构的带宽、容错与跨代硬件实测数据,可据此判断大规模预训练基础设施的演进方向。
OpenAI 发布 Privacy Filter,这是一款开放权重模型,用于检测和脱敏文本中的个人身份信息(PII),官方称其准确率达到 state-of-the-art 水平。
推荐理由:OpenAI 开源了一款用于识别和脱敏文本中个人身份信息的模型,可了解其在 PII 检测上的定位。
Google 发布 TurboQuant 压缩算法,可将 KV cache 量化到 3 bit,无需训练或微调且不损失模型精度,相关论文将亮相 ICLR 2026。
推荐理由:Google 公布 TurboQuant 等三种向量量化算法,读者可了解 KV cache 压缩到 3 bit 且不损失精度的实现路径。
Google Research 与多家 NHS 机构合作的 AIMS 研究在 Nature Cancer 发表两项姊妹研究,评估 AI 乳腺筛查系统。
推荐理由:两项 Nature Cancer 研究给出了 AI 在 NHS 乳腺筛查中的前瞻部署数据与人工仲裁交互结果,可了解落地时的数据漂移与仲裁量问题。
Mistral AI 推出 Forge,一个让企业基于专有知识构建前沿级 AI 模型的系统,支持预训练、后训练和强化学习等阶段。Forge 支持 dense 与 MoE 两种架构,并可按需支持多模态输入,模型可在企业自有基础设施内训练和治理。
推荐理由:原文给出了企业用自有数据训练前沿模型的分阶段能力与多架构支持,读者可据此判断自建模型的落地路径。
Google 宣布在 Flood Hub 上线城市山洪预报,借助新的 AI 方法可在城市地区提前最多 24 小时预测山洪风险。为弥补山洪缺乏地面实测数据的问题,Google 用 Groundsource 方法结合 Gemini 分析公开新闻报道,构建历史山洪事件数据集来训练和评估新模型。
推荐理由:Google 把城市山洪预警接入 Flood Hub,读者可了解其用 Gemini 从新闻中提取训练数据的思路与全球覆盖取舍。
Google 推出 Groundsource,一种用 Gemini 从非结构化全球新闻中提取灾害数据的可扩展方法,并开放首个城市山洪数据集,包含 260 万条记录、覆盖 150 多个国家、时间跨度从 2000 年至今。
推荐理由:原文给出了用 Gemini 从新闻抽取灾害数据的方法与验证结果,读者可据此判断 LLM 构建历史基准的可行边界。
Hugging Face 在 Hub 上推出 Storage Buckets,一种非版本化的 S3 式可变对象存储,用于存放 checkpoint、优化器状态、处理后的分片和 Agent traces 等中间产物。
推荐理由:原文给出 Buckets 的创建、同步与 Python 调用方式,读者可据此判断它能否替代现有中间产物存储流程。
LeRobot v0.5.0 发布,自 v0.4.0 以来合并 200 多个 PR、新增 50 多位贡献者,首次加入 Unitree G1 人形机器人支持,涵盖运动、操作、遥操作与全身控制。
推荐理由:从人形机器人支持到策略库与数据管线提速,读者可据此判断开源机器人栈当前覆盖的硬件与训练能力。
Photoroom 发布 PRX 系列第三篇,用 32 张 H200、约 1500 美元算力预算在 24 小时内完成一次文生图模型训练,并开源训练代码与实验框架。
推荐理由:Photoroom 公开了 24 小时训练文生图模型的完整配方与代码,读者可据此复现并调整各组件。