Google Research 跨人群基因组预测的迁移学习研究
Google Research 用 UK Biobank 欧洲人群数据向 Biobank Japan 近 20 万日本人样本做多基因风险评分迁移学习,覆盖 BMI、血压、血脂、血糖等 8 项临床性状。结果显示目标人群样本达 15k 以上时,本地训练模型反超混合欧洲数据训练;HDL、LDL 和血糖等人群特异性强的性状从欧洲数据获益更少。
Google Research 用 UK Biobank 欧洲人群数据向 Biobank Japan 近 20 万日本人样本做多基因风险评分迁移学习,覆盖 BMI、血压、血脂、血糖等 8 项临床性状。结果显示目标人群样本达 15k 以上时,本地训练模型反超混合欧洲数据训练;HDL、LDL 和血糖等人群特异性强的性状从欧洲数据获益更少。
Google Research 与 HHMI Janelia 等机构在 Cell 发表雄性果蝇完整中枢神经系统连接组,包含超过 166,000 个神经元和 1.25 亿个突触连接,是迄今神经元数量最多的脑图谱。
推荐理由:读者可了解AI驱动的连接组学如何完成迄今神经元数量最多的脑图谱,以及它向脊椎动物扩展的路径。
Google DeepMind 与 Google Research 发布 WeatherNext 3,称其为目前最先进的全球天气 AI 模型,可直接学习实时卫星观测数据,逐小时生成预报。
推荐理由:WeatherNext 3 把实时卫星数据与逐小时更新纳入全球天气预报,读者可据此了解 AI 气象模型在分辨率与降水精度上的进展。
Hugging Face 博主用 TRL 和 OpenEnv 复现了 Surya Narreddi 让语言模型画水彩的思路,模型通过 p5.brush 写出约 150 行 JavaScript 作画,全部数据集、RL 环境、训练脚本与模型均已开源。
一份公开的低成本方案用 TRL 的 GRPO 对 LFM2.5-350M 做微调,仅约 500 条样本、100 个训练步,在 IFStruct 基准上把通过率从 22.6% 提升到 29.7%。训练可在免费档 Colab 或 Kaggle GPU 上完成,评测则通过 llama.cpp 在本地 MacBook 上运行,代码已开源于 GitHub。
Hugging Face 推出 BenchMIRT,一种在单条提示词层面审计 LLM 基准测试的新方法,基于多维项目反应理论(MIRT)分离同一基准中混杂的能力信号。
Google Research 提出 MAPL-EMIT,一个基于 Swin-S vision transformer 的深度学习框架,可从 NASA EMIT 高光谱卫星数据中自动检测、量化甲烷羽流并定位排放源,在专家标注羽流上召回率达 84%。
Google 推出 TimesFM-3 时间序列基础模型,330M 参数、在超 1 万亿时间点上预训练,原生支持多变量零样本预测,单次前向即可输出完整预测区间。它支持多目标、历史协变量与已知未来协变量,并在 Gift-Eval、FEV-Bench 和 Time 三个公开基准上取得点预测与概率预测双项第一。
微软研究院推出 GigaPath-Flash 和 GigaTIME-Flash,以蒸馏自十亿参数 GigaPath 编码器的 22M 参数 ViT-S 骨干大幅降低病理基础模型算力需求,并以 Apache 2.0 许可开放。
Hugging Face 与 Voice Arena 合作,在 Open ASR Leaderboard 上新增 Monsoon en-IN 和 Monsoon hi-IN 两个评测集,印地语成为该多语言榜单上首个 Indic 语言。四个公开/私有 split 共覆盖 4,888 名说话人,每人记录 12 项属性,且说话人不重叠;印地语集采用 lattice 标注以容纳多种可接受的拼写变体。
Google Earth AI 推出实验性研究能力行星预测引擎(PPE),可依据自然语言查询自主完成地理空间数据发现、特征工程、模型训练与评估,把原本需要数周人工数据工程的建模流程缩短到几分钟。
推荐理由:原文给出PPE在公共卫生、粮食安全与疫情预测上的基准对比,可了解地理空间建模自动化的能力边界。
Google Research 发布 GlucoFM,一个自监督双流基础模型,将血糖的慢变基线趋势与短期波动分离,并保留时间与缺失信息。模型在 109,066 小时无标注 CGM 数据上预训练,覆盖 4 个队列、7 项临床任务共 14 组评估,平均 PR-AUC 比同语料预训练的最佳 GluFormer 变体高 5.8 个百分点。
Sentence Transformers v6.0 新增 MultiVectorEncoder 模型类型,支持 ColBERT 式后期交互检索及其完整训练流程。
IBM Granite 团队发布 Granite 4.2,这是其首个稠密 decoder-only 推理模型家族,包含 3B、8B、30B 三个规模,全部以 Apache 2.0 许可开源。
Multiverse Computing 发布论文《Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs》,提出 QAH 方法:在结构压缩并量化后,直接从压缩前的原始模型蒸馏,而非从恢复出的 bfloat16 检查点蒸馏。
推荐理由:论文给出压缩加量化后从原始模型蒸馏的恢复配方,并附9项基准对比与QAT稳定性差异。
OpenAI CFO Sarah Friar 阐述了芯片、算力、模型与产品各层面的进步如何相互叠加,从而以更大规模和更低成本交付更有用的智能。她将这一链条称为"充裕智能"背后的全栈。
METR 分析发现 AI 对科研的加速并不均衡:2026 年网络安全漏洞报告速度较 2025 年大幅加快,数学领域贡献有限,AI 研究本身的算法进展则未见可测加速。多校团队提出 SPADE 框架,让 LLM 交替生成可执行训练环境并求解,在 Qwen3-30B-A3B 上使游戏环境套件均分达 58.3,较基线提升 8.1。
Google 发布 Biomarker Discovery Framework,一个多智能体系统,将候选生物标志物优先级排序构建为人类监督下的迭代研究闭环,结合假设生成、并行统计分析、模型训练、对抗验证与文献推理。
Google Research 提出 Mobility-Embedded POIs(ME-POIs)框架,将匿名化移动性模式与文本描述结合,为地点生成同时编码身份与动态功能的嵌入向量。
微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据量为此前首个公开版本的 2.5 倍,在 GMTKN55 的 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol。Skala 现已在 CP2K 中可用,并正被集成进 Psi4、FHI-aims、ORCA 和 VASP,同时微软研究院推出持续追踪各版本计算性能的 living benchmark。
IBM Research 在 Hugging Face 博客发布 ALTK-Evolve 研究,用 AppWorld 的 585 个多步任务评测八款模型,发现智能体记忆不是开关而是需要按模型校准的剂量。
推荐理由:八模型对比给出了智能体记忆的三种剂量模式与 token 开销数据,可据此判断自家模型该用全量还是检索式注入。
Hugging Face 构建了约束感知的 GPU 分配器,在相同硬件和负载下对比 FIFO 调度器,七个基准场景中 GPU 利用率最高提升 33 个百分点,优先级加权产出最高提升 105%。在五个真实争用场景中,利用率从 52–85% 提升至 72–88%,优先级加权价值平均提升 52%。核心变化不在硬件,而在于分配决策的顺序:实时推理按需求曲线逐时间步分配,批式任务按优先级跨整个调度周期排布。
Import AI 第 469 期介绍了 DiG-bench(Discovery in Games)基准,包含 70 款规则与目标均隐藏、需靠探索发现的游戏,其中 21 款已公开。
Google 推出 PhotoScan,一个可从普通 2D 手机照片估算体脂率(BF%)、Android-to-Gynoid 脂肪比(A/G)和内脏-皮下脂肪面积比(V/S)的深度学习框架。
Hugging Face 发布 2026 年 1 月至 8 月的开源模型生态观察报告,模型仓库从 243 万增至 296 万,数据集从 71.1 万增至 100 万,Spaces 从 100 万增至 144 万。
推荐理由:Hugging Face 用 Hub 七个月的数据拆解开源模型格局,读者可据此理解下载量与点赞为何指向不同事实。
AWS 开源 SDK Strands Robots(Apache 2.0)演示了机器人数据闭环:用 Robot("so100") 录制 LeRobotDataset 并同步到 Hugging Face Storage Buckets。
Hugging Face 的 OlmoEarth Studio 现已支持计算并导出嵌入向量,用户可通过 UI 或 API 选择区域、时段、编码器变体和影像源,获得 Cloud-Optimized GeoTIFF 格式结果。
微软研究院推出 MindTopo 基准,用于评测多模态大模型在连通性、封闭、顺序、分离与打结五类拓扑关系上的推理与规划能力。测试显示,模型在静态图像识别上表现明显优于交互式规划任务,且两者均远低于人类水平;失败多发生在规划阶段而非感知阶段,模型在场景变化中会丢失结构关系或提出违反物理约束的动作。图像与视频生成仅在单帧关系可见时偶有帮助,序列任务中仍不可靠。
微软研究院发布研究模型 CARE-X,一个统一胸部 X 光 VLM,可同时完成报告生成、结构化预测与病灶定位等任务,并用强化学习(DAPO)在多任务设置下奖励临床正确性。
Hugging Face 的 ALTK-Evolve 在 AppWorld 上以按需检索指南替代 ACE 的全量 playbook 注入,用更少 Token 取得更高任务完成率。
Import AI 第 468 期汇总了智库 IFP 提出的 23 条"低后悔"政策建议,分属 7 个类别,用于应对 AI 研发自动化带来的风险。MIT 与 Columbia 的论文《Racing to Ruin》分析称,竞争对手间实现协调减速取决于技术开发的透明度与对彼此可信度的判断:低信任下所有均衡都奔向灾难,高信任下两家理性企业永远竞赛的概率随理性先验比值平方衰减。
Hugging Face 最新论文提出两项系统改动,让 LLM 知识蒸馏成本大幅下降:先离线缓存教师模型的 top-100 logits,使教师模型无需与学生模型同时驻留显存;再用融合分块 KL 损失,避免生成完整的词表×序列长度矩阵。
Google DeepMind 在 Nature 发表论文,称 WeatherNext AI 模型在预测气旋路径、强度和风场结构上达到 SOTA,平均多出一天(24 小时)的预报提前量,三天预报精度相当于此前模型的两天水平。
推荐理由:Google DeepMind 在 Nature 论文中给出气旋路径与强度预报的精度提升,并同步开源模型权重,读者可据此了解 AI 天气预报的当前进展与可用入口。
微软研究院发布开源框架 Orchard,核心是 Kubernetes 环境服务 Orchard Env,可跨任务域复用环境、数据管线和评测流程,并支持直接在 Codex、OpenClaw、ZeroClaw 等真实 harness 中训练智能体。
推荐理由:Orchard 把环境层做成可复用服务,并公开训练数据与评测方法,读者可据此判断开放智能体训练的成本门槛变化。
Google Research 提出 Chain-of-Evidence(CoE)可验证性框架,并落地为自主科研原型 Science One Framework 与自动审计指标 CoE Audit。
推荐理由:Google 提出可验证性框架 Chain-of-Evidence,并给出自动审计指标,读者可据此了解自主科研智能体的可信度如何被量化。
Hugging Face 博客指出,AI 的下一个真正约束不是智能而是 GPU 利用率:GPU 成本按日历小时累积,产出却只按计算小时计,因此两家 GPU 预算相当的公司会因利用率差异而拉开经济性差距。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的交互摘要隔离为自然语言"信念状态"并加以监督评分,替代完整交互历史作为智能体的工作上下文。在协作编程基准 CollabBench 上,采用重建式信念评分的 ABBEL-rec-BG 将自摘要模型与全上下文模型的性能差距缩小约 50%,训练步数从 100 步降至 50 步,峰值上下文 token 数也低于全上下文设置。
Google 在 DOE Genesis Mission Summit 2026 上宣布投入 4000 万美元的 AI tokens 和云 credits,支持 Genesis Mission 的研究人员。
Hugging Face 博客发布开源低成本机器人操作数据采集系统 Grabette,用手持夹爪加双摄像头记录人类演示,自动转换为 LeRobot 数据集。Grabette 手持端 BOM 成本约 490€,配套的 Gripette 电动夹爪约 120€,硬件 CAD、采集服务、处理流水线和示例训练栈全部开源,处理流程可在浏览器中通过 HF Space 完成。
推荐理由:原文给出了手持夹爪采集机器人操作数据的完整开源方案与成本,读者可据此判断数据采集门槛的变化。
DharmaOCR 在葡萄牙语专项基准上以 0.925 分领先 Mistral OCR4 的 0.798 和 Unlimited-OCR 的 0.7587,后两者分别落后约 13 分和 16 分以上。该模型经葡萄牙语监督微调加 DPO 两阶段训练,把全部参数集中于巴西葡萄牙语,在复杂文档提取质量和生成稳定性上形成结构性优势。文章认为,新架构并未改变这一领域专精带来的差距。