用 HuggingFace ML-intern 以约 103 美元训练 6 个模型的实践与提示词方法
作者在 HuggingChat 中开启 ML-intern 模式,几天内用约 USD 103 的总算力成本训练并发布了 6 个模型,包括 0.8B 的 Qwen-Image 2.1 提示词重写器(CPU 可跑。
推荐理由:作者公开了七条完整提示词和预算、基线、冒烟测试三条可复用的提示词写法,读者可直接照搬到自己的微调项目。
作者在 HuggingChat 中开启 ML-intern 模式,几天内用约 USD 103 的总算力成本训练并发布了 6 个模型,包括 0.8B 的 Qwen-Image 2.1 提示词重写器(CPU 可跑。
推荐理由:作者公开了七条完整提示词和预算、基线、冒烟测试三条可复用的提示词写法,读者可直接照搬到自己的微调项目。
Google Research 与 NBER 合作发表的三个月田野实验显示,在 133 名律师、11 家知识产权律所中随机开放 Google Labs AI 专利撰写工具(现属 Gemini Notebook)后,10 天和 90 天的起草评分分别提升 0.34 和 0.38 个标准差。
推荐理由:研究用三个月随机对照实验区分了AI辅助产出与无辅助判断,可帮助读者理解AI对不同资历从业者技能积累的差异影响。
Microsoft Research Asia 提出 Harnessed Agentic RL 训练范式并开源 Agent Lightning v1.0,约 3,500 行代码实现完整智能体 RL 控制面,让部署所用的 agent harness 直接参与强化学习,无需在训练框架中重新实现智能体。
推荐理由:原文给出了训练范式、架构与实测数据,读者可据此评估轻量框架能否降低智能体 RL 训练门槛。
Google Research 介绍以 Earth AI 的 Population Dynamics Foundation Model(PDFM)作为公共卫生领域的行星地理基础模型概念验证,将隐私保护的搜索趋势、人类流动、建成环境密度与环境因素压缩为月度刷新的位置嵌入,无需任务特定微调即可直接接入流行病学现有工作流。
推荐理由:原文用五个独立合作评估展示了同一组位置嵌入在不同疾病与资源环境下的可迁移性,读者可据此判断地理基础模型在公共卫生工作流中的实际适用边界。
uniopen 通过 Amazon SageMaker AI 对 Amazon Nova 2 Lite 做监督微调,并叠加提示词级输出优化,使其适配自身零售审核策略。
在 Amazon SageMaker AI 上可用多轮强化学习(MTRL)微调搜索智能体,官方示例以 Qwen3.6-27B 为基础模型,在 us-west-2 区域训练,智能体配备 BM25 词法搜索与向量搜索两个工具。
Ai2 开源 AstaBrief 8B,一个把研究问题和检索到的文献片段转成带引用报告的模型,基于 Qwen3-8B 经 SFT 和 DPO 训练,权重与训练数据一并开放。
Google 宣布推出基于可信执行环境(TEE)的新一代联邦学习系统,为数据匿名化提供可远程验证和审计的保证,Gboard 已采用该系统上线英语和日语下一词预测模型。
推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,并给出 Gboard 已上线的落地情况,可了解隐私可验证训练的一种工程路径。
ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败与更强教师的成功来定位能力缺口,并生成、验证新的可执行训练任务,课程随模型进步向仍难的任务迁移。该方法以 EnterpriseOps Gym 数据集演示,任务由系统规范、用户提示词和验证器三部分组成,需满足可行性、真实性与难度要求。
Amazon Quick 为 AI 构建的应用推出 Live Data in Apps,可在用户每次打开应用时实时查询受治理的 Quick Sight 数据集,取代发布时固化的静态快照。该功能支持 SPICE 与 Direct Query 两种数据集模式,查询以查看者身份执行,自动沿用既有行级与列级安全规则,查看者需为已认证的 Quick 用户并首次按数据集授权。
NVIDIA NeMo Agent Toolkit(NAT)可通过自定义 memory provider 将 Amazon S3 Vectors 用作持久记忆层,并部署在 Amazon EKS 上。
Amazon Payments 在 Amazon SageMaker AI 上用多目标上下文多臂老虎机(LinUCB)为产品获客漏斗做个性化内容选择,七周线上 A/B 测试中,一个人群的最终漏斗转化率相对提升达高个位数百分比,另一个人群则未见改善,问题出在内容而非模型。
微软研究院实习生开发了一套端到端机器学习流水线,为美国本土 66,935 座变电站生成空间天气风险预测,可提前 30 至 60 分钟预警。系统结合 AE 与 Dst 指数预测、地质电导率和电网数据,在 2020-2026 评估期内检测到近 80% 的重大空间天气事件,其中 Dst 预测在 62.2% 的高活跃时段优于 Burton 方程。
Google DeepMind 推出 SynthID Bio,将水印技术引入合成生物学,把不可感知的签名直接嵌入生物代码,使其在数字模型和合成出的实体蛋白质上均可验证,同时保持生物功能。
推荐理由:原文给出了水印嵌入方式与湿实验验证结果,读者可据此判断AI生成生物设计的溯源路径。
CoreWeave 宣布在 CoreWeave Cloud 上线 NVIDIA Vera Rubin NVL72 系统与 Spectrum-X 102.4T 以太网,Cognition 成为首个在生产环境运行该平台、支撑 Devin 的客户,早期测试中 SWE-2 推理总 token 吞吐量较 GB200 NVL72 最高提升 4.8 倍。
NVIDIA 发布开源表格基础模型 Kumo Tabular,给定带标签的表格行即可在单次前向传播中预测新行标签,无需训练、调参和特征工程,同时支持分类与回归。
推荐理由:原文给出模型规模、训练数据来源与四个基准排名,可据此判断表格基础模型相对梯度提升树路线的差异。
微软研究院推出 Quine,一个面向生物学复杂性的 AI 研究系统,由生物学世界模型和连接模型、科学工具、文献与研究者的交互式 harness 两部分组成。该系统与 Broad Institute 合作用于胰腺导管腺癌(PDAC)研究,从数千个化合物中筛选并优先排序可驱动肿瘤细胞状态转变的候选物,最高排名的化合物在湿实验中产生了最大的预期状态转变,整个流程仅用一个周末完成。
推荐理由:微软研究院公开 Quine 的生物学世界模型与实验编排框架,并给出胰腺癌化合物筛选的湿实验验证结果。
Mistral 在慕尼黑开设德国中心,组建专注 Physics AI 与工业 AI 的研究团队,并计划到 2030 年建成 1 吉瓦欧洲算力。该中心将直接服务企业客户,已与 BMW 合作碰撞仿真与工程 AI、与 Siemens Energy 合作工业 AI 应用,并与慕尼黑工业大学(TUM)建立研究合作,利用其风洞设施开发汽车空气动力学数字孪生。
Hugging Face Hub 新增 RL Environments 专区,用带 rl-environment 标签的 dataset 仓库承载强化学习环境,不引入新仓库类型或注册表。
推荐理由:原文说明了用数据集标签替代独立注册表的做法,读者可据此判断它如何简化跨框架的环境复用。
NVIDIA 联合 Google DeepMind、EMBL-EBI 等机构,通过 AlphaFold Database 开放发布 2800 多种病毒的蛋白质复合物预测 3D 结构,供全球科学家免费使用。
NVIDIA 验证工程师 Sakeena Fiza 在数据中心系统工程实验室负责产品量产前的硬件验证,她回忆 NVIDIA Rubin GPU 首次在系统级成功枚举时团队集体欢呼。她将验证工作比作破案,目标是在客户发现问题之前先发现并解决问题,单块板卡可能包含数万个组件,一个机架接近 50 万个。
NVIDIA 在埃及大埃及博物馆举办 AI 生态活动,埃及的 NVIDIA Deep Learning Institute 学员规模一年内增长超十倍。Hassan Allam Utilities 与 A15 将开发新数据中心,投资约 4 亿美元;Cassava 与 Vodafone Egypt 宣布 AI factory 计划,通过 GPU-as-a-service 提供本地托管 AI 基础设施。
微软研究院在 Nature 发表逆合成模型 RetroChimera,并开源其实现与权重。该模型用学习式重排序整合 Transformer 模型 R-SMILES 2 与 GNN 模型 NeuralLoc,在盲测中化学家更偏好其单步反应预测;十个挑战性目标的多步路线中 RetroChimera 成功九个,优于 de novo 模型的五个、编辑模型的四个和 NeuralSym 的两个。
Hex 的数据智能体借助 GPT-6 Astra,把分析答案转化为可交互的可视化报告,供员工直接分享。
Google Research 提出 Retrieve-for-Train 框架,通过离线强化学习发现奖励对齐的查询扇出并编译为监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,实现推理时单次非自回归的查询扇出。
Google Research 在 ACL 2026 提出 ToolGrad,用“先答案后问题”范式生成工具调用数据:先迭代构建可验证的 API 工作流,再反向标注用户查询,数据生成通过率接近 100%。
César de la Fuente 的实验室利用 Codex 和 ChatGPT 从现存与已灭绝生物的基因组中搜寻抗菌候选分子,以对抗耐药性感染。
OpenAI 在 ChatGPT Work 中推出 Data agent,用户可连接公司数据、发现洞察,并用自然语言构建交互式仪表盘。该功能面向所有用户开放。
TRL v1.14 的 AsyncGRPOTrainer 现已支持只训练并同步 LoRA adapter 到 vLLM,rank-1 adapter 仅几 MB,可通过挂载在三个 HF Jobs 上的 Storage Bucket 传输,无需 NCCL。
Google DeepMind 发布 AlphaGenome Atlas,一个包含人类基因组 90 亿个单核苷酸变异效应预测的平台,规模达 1PB,超过 AlphaFold Database 的 30 倍。
推荐理由:读者可了解 AlphaGenome Atlas 如何把 90 亿个单核苷酸变异的预测结果做成可检索资源,以及 AVI 评分在编码与非编码区的用途。
Google Research 用 UK Biobank 欧洲人群数据向 Biobank Japan 近 20 万日本人样本做多基因风险评分迁移学习,覆盖 BMI、血压、血脂、血糖等 8 项临床性状。结果显示目标人群样本达 15k 以上时,本地训练模型反超混合欧洲数据训练;HDL、LDL 和血糖等人群特异性强的性状从欧洲数据获益更少。
Google Research 与 HHMI Janelia 等机构在 Cell 发表雄性果蝇完整中枢神经系统连接组,包含超过 166,000 个神经元和 1.25 亿个突触连接,是迄今神经元数量最多的脑图谱。
推荐理由:读者可了解AI驱动的连接组学如何完成迄今神经元数量最多的脑图谱,以及它向脊椎动物扩展的路径。
Google DeepMind 与 Google Research 发布 WeatherNext 3,称其为目前最先进的全球天气 AI 模型,可直接学习实时卫星观测数据,逐小时生成预报。
推荐理由:WeatherNext 3 把实时卫星数据与逐小时更新纳入全球天气预报,读者可据此了解 AI 气象模型在分辨率与降水精度上的进展。
Hugging Face 博主用 TRL 和 OpenEnv 复现了 Surya Narreddi 让语言模型画水彩的思路,模型通过 p5.brush 写出约 150 行 JavaScript 作画,全部数据集、RL 环境、训练脚本与模型均已开源。
一份公开的低成本方案用 TRL 的 GRPO 对 LFM2.5-350M 做微调,仅约 500 条样本、100 个训练步,在 IFStruct 基准上把通过率从 22.6% 提升到 29.7%。训练可在免费档 Colab 或 Kaggle GPU 上完成,评测则通过 llama.cpp 在本地 MacBook 上运行,代码已开源于 GitHub。
Hugging Face 推出 BenchMIRT,一种在单条提示词层面审计 LLM 基准测试的新方法,基于多维项目反应理论(MIRT)分离同一基准中混杂的能力信号。
Google Research 提出 MAPL-EMIT,一个基于 Swin-S vision transformer 的深度学习框架,可从 NASA EMIT 高光谱卫星数据中自动检测、量化甲烷羽流并定位排放源,在专家标注羽流上召回率达 84%。
Google 推出 TimesFM-3 时间序列基础模型,330M 参数、在超 1 万亿时间点上预训练,原生支持多变量零样本预测,单次前向即可输出完整预测区间。它支持多目标、历史协变量与已知未来协变量,并在 Gift-Eval、FEV-Bench 和 Time 三个公开基准上取得点预测与概率预测双项第一。
微软研究院推出 GigaPath-Flash 和 GigaTIME-Flash,以蒸馏自十亿参数 GigaPath 编码器的 22M 参数 ViT-S 骨干大幅降低病理基础模型算力需求,并以 Apache 2.0 许可开放。
Hugging Face 与 Voice Arena 合作,在 Open ASR Leaderboard 上新增 Monsoon en-IN 和 Monsoon hi-IN 两个评测集,印地语成为该多语言榜单上首个 Indic 语言。四个公开/私有 split 共覆盖 4,888 名说话人,每人记录 12 项属性,且说话人不重叠;印地语集采用 lattice 标注以容纳多种可接受的拼写变体。