如何在连续批处理中实现异步化:分离 CPU 与 GPU 负载提升推理吞吐
Hugging Face 详解如何在连续批处理中引入异步化,把 CPU 批次准备与 GPU 批次计算解耦并行执行。同步批处理下 CPU 与 GPU 轮流工作,用 8B 模型、batch size 32 生成 8K tokens 耗时 300.6 秒,其中 24.0% 时间 GPU 处于空闲等待 CPU。
Hugging Face 详解如何在连续批处理中引入异步化,把 CPU 批次准备与 GPU 批次计算解耦并行执行。同步批处理下 CPU 与 GPU 轮流工作,用 8B 模型、batch size 32 生成 8K tokens 耗时 300.6 秒,其中 24.0% 时间 GPU 处于空闲等待 CPU。
Hugging Face 博客发布系列文章,分析 AWS 基础设施如何与开源软件栈配合支撑基础模型全生命周期。文章指出 scaling 已从单一预训练曲线演变为预训练、后训练与测试时计算三条路径,并梳理了 Slurm、Kubernetes、PyTorch、JAX、Prometheus、Grafana 等 OSS 工具的分层架构。
Hugging Face 与 Appen Inc.、DataoceanAI 合作,为 Open ASR Leaderboard 引入覆盖多口音、朗读与对话语音的高质量英文 ASR 私有数据集,以防 benchmaxxing 和测试集污染。
IBM Granite 团队发布技术文章,详解 Granite 4.1 系列稠密 LLM(3B、8B、30B)的训练流程:约 15T tokens 五阶段预训练,上下文窗口经长上下文扩展至 512K tokens,随后用约 4.1M 条高质量样本做 SFT,并采用 on-policy GRPO 配合 DAPO loss 的多阶段强化学习。
推荐理由:Granite 4.1 团队公开了从数据配比到多阶段 RL 的完整训练细节,可对照其 8B 稠密模型追平 32B MoE 的结论。
DeepInfra 现已作为 Inference Provider 接入 Hugging Face Hub,首批支持对话与文本生成任务,可调用 DeepSeek V4、Kimi-K2.6、GLM-5.1 等开放权重 LLM,后续将扩展至文生图、文生视频和嵌入向量等任务。
OpenAI 本周在 Hugging Face Hub 开源 Privacy Filter,一个 1.5B 参数、50M 激活参数的 PII 检测模型,Apache 2.0 许可,单次前向即可在 128k 上下文内标注八类个人信息,并在 PII-Masking-300k 基准上达到 SOTA。
Hugging Face 发布 Transformers.js 浏览器扩展教程,演示如何在 Manifest V3 约束下用 Gemma 4 E2B 构建本地 AI 功能。
Hugging Face 发布 QIMMA(阿拉伯语"顶峰")阿拉伯语 LLM 排行榜,在评测模型前先对基准做质量验证,整合 14 个来源基准的 109 个子集、超 52,000 条样本,覆盖 7 个领域,其中 99% 为原生阿拉伯语内容,也是首个含代码评测的阿拉伯语排行榜。验证发现 ArabicMMLU 丢弃率 3.1%、MizanQA 2.3%,问题涵盖答案错误、文本损坏与文化偏见。
Hugging Face 发文讨论 Mythos 与 Project Glasswing 发布后 AI 网络安全格局,指出 Mythos 的漏洞发现与修补能力来自模型、算力、安全脚手架与自主性组成的系统配方,而非单一模型。文章认为开源代码与工具能分散检测、验证、协调、补丁传播四个环节,避免闭源单点故障,并主张采用半自主 AI 智能体在人类可控前提下进行防御。
Hugging Face Blog 发布文章《Welcome Gemma 4: Frontier multimodal intelligence on device》,标题显示 Gemma 4 是一款面向端侧设备的前沿多模态模型。原文正文未能抓取,暂无更多细节。
Mistral AI 发布首个文本转语音模型 Voxtral TTS,4B 参数,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言,可做情感表达与零样本跨语言音色适配。
推荐理由:官方给出 4B 参数、9 种语言、70ms 延迟与每千字符 0.016 美元的定价,读者可据此判断语音智能体的成本与选型空间。
H Company 发布 Holotron-12B,一个基于 NVIDIA Nemotron-Nano-2 VL 后训练的多模态计算机操作模型,已在 Hugging Face 上线,采用 NVIDIA Open Model License。
推荐理由:原文给出混合 SSM 架构带来的吞吐对比数据与 WebVoyager 提升幅度,可据此判断计算机操作智能体的部署成本。
Hugging Face 对 16 个围绕异步训练构建的开源 RL 库做了横评,按编排原语、rollout buffer 设计、权重同步协议、陈旧度管理、部分 rollout 处理、LoRA 支持与分布式训练后端 7 个维度对比。
Hugging Face 在 Hub 上推出 Storage Buckets,一种非版本化的 S3 式可变对象存储,用于存放 checkpoint、优化器状态、处理后的分片和 Agent traces 等中间产物。
推荐理由:原文给出 Buckets 的创建、同步与 Python 调用方式,读者可据此判断它能否替代现有中间产物存储流程。
LeRobot v0.5.0 发布,自 v0.4.0 以来合并 200 多个 PR、新增 50 多位贡献者,首次加入 Unitree G1 人形机器人支持,涵盖运动、操作、遥操作与全身控制。
推荐理由:从人形机器人支持到策略库与数据管线提速,读者可据此判断开源机器人栈当前覆盖的硬件与训练能力。
Hugging Face 博客详解源自 Snowflake AI Research 的 Ulysses 序列并行(ALST 协议的一部分),通过注意力头并行与 all-to-all 通信把长序列切分到多 GPU,突破单卡显存限制。
Hugging Face 博客发布 NXP 的实践指南,介绍如何在嵌入式机器人平台上部署 VLA 模型,涵盖数据集录制、ACT 与 SmolVLA 策略微调以及端侧优化。文中以“把茶包放进杯子”任务为例,录制 120 个 episode,将工作空间划分为 11 个 10×10 cm 起始位置簇,并建议约 20% 训练集为恢复 episode。NXP i.MX 95 SoC 在优化后实现了实时性能。
Hugging Face 发布 Modular Diffusers,用可复用的 block 组合扩散流水线,作为 DiffusionPipeline 之外更灵活的替代方案。
推荐理由:原文给出可组合模块的 API 与自定义块示例,读者可据此判断扩散流水线改写的成本与迁移路径。
Photoroom 发布 PRX 系列第三篇,用 32 张 H200、约 1500 美元算力预算在 24 小时内完成一次文生图模型训练,并开源训练代码与实验框架。
推荐理由:Photoroom 公开了 24 小时训练文生图模型的完整配方与代码,读者可据此复现并调整各组件。
Hugging Face 发文介绍 transformers 库如何为 MoE 模型重构支持,涵盖权重加载、专家后端、专家并行与训练四部分。权重加载引入 WeightConverter 与惰性物化,将 256 个独立专家张量打包为单个连续张量;在 Qwen1.5-110B-Chat 上,v5 异步加载耗时 20.71s,v4 为 66.24s,张量并行下为 10.1s。
Hugging Face 宣布 GGML(llama.cpp 的创建者)加入 HF,Georgi Gerganov 及团队一同加入,目标是持续支持 ggml 与 llama.cpp 社区,让未来 AI 保持开放。
推荐理由:GGML 与 llama.cpp 团队加入 Hugging Face,读者可了解本地推理项目在资源与维护模式上的变化。
Hugging Face 发布教程,介绍如何通过 Claude Code、Codex 等编码智能体,用 Unsloth 和 Hugging Face Jobs 微调 LiquidAI/LFM2.5-1.2B-Instruct。
推荐理由:原文给出用编码智能体提交微调任务的完整命令与技能安装步骤,读者可据此复现小模型训练流程。
IBM Research 与 UC Berkeley 用 MAST 失败分类法分析 ITBench 中 310 条 SRE 执行轨迹,覆盖 Gemini-3-Flash、Kimi-K2 和 GPT-OSS-120B 三类模型。
Hugging Face 博客介绍 Gradio 6 中 gr.HTML 的新能力,支持自定义模板、作用域 CSS 和 JavaScript 交互,可在单个 Python 文件中完成前端、后端与状态管理,无需构建步骤即可部署到 Hugging Face Spaces。
推荐理由:原文给出 gr.HTML 的模板、状态同步与子类化写法,读者可据此把自定义组件直接接入现有 Gradio 流程。
Hugging Face 发布 cuda-kernels Agent Skill,让 Claude、Codex 等编码智能体为 diffusers 和 transformers 项目编写生产级 CUDA 内核,并生成 PyTorch 绑定与基准脚本。
推荐理由:原文给出可安装的 CUDA 内核技能与完整基准数据,读者可据此判断智能体写内核的可行边界。
Hugging Face 博客介绍 Meta 与 Hugging Face 合作的开源框架 OpenEnv,它用 gym 风格 API(reset、step、action、observations)和标准 MCP 工具调用接口,把智能体接到浏览器、代码仓库、日历等真实系统而非模拟环境中评测。
推荐理由:Meta 与 Hugging Face 的 OpenEnv 框架及 Turing 的 Calendar Gym 给出了智能体在真实权限与多步环境下的失败模式数据。
Hugging Face 发布 Transformers.js v4,已上线 NPM,可通过 npm i @huggingface/transformers 安装。
推荐理由:官方披露了 WebGPU 运行时重写、构建提速与包体积变化,可据此判断浏览器端本地推理的工程成熟度。
Hugging Face 发布 SyGra 2.0.0 的 Studio,把合成数据生成搬到画布上,可视化编排流程并自动生成 SyGra 兼容的图配置与任务执行脚本。
Mistral AI 发布 Voxtral Transcribe 2,包含面向批量转写的 Voxtral Mini Transcribe V2 和面向实时场景的 Voxtral Realtime 两款语音转文字模型。
推荐理由:原文给出两款语音转写模型的延迟、价格与开源许可,读者可据此判断实时语音应用的选型空间。
Hugging Face 推出 Community Evals,基准数据集仓库现在可以注册为 benchmark 并在数据集卡片上展示排行榜,模型仓库通过 .eval_results/*.yaml 存放自己的评测分数。
推荐理由:Hugging Face 把评测分数从黑箱榜单搬到 Hub 仓库,读者可了解社区提交与复现机制如何运作。
H Company 发布迄今最大的 UI 定位模型 Holo2-235B-A22B Preview,在 ScreenSpot-Pro 上以 78.5% 刷新 SOTA,OSWorld G 达 79.0%,已在 Hugging Face 开放。
Hugging Face 博客第三篇中国开源 AI 系列文章指出,开源已成为中国 AI 机构未来一段时间的主流路线。Qwen 在 Hugging Face 上的衍生模型超过 113k、相关仓库超 200k,远超 Llama 的 27k 和 DeepSeek 的 6k;DeepSeek 与 Qwen 分别是 Hugging Face 关注度第一和第四的组织。
Hugging Face 公布 PRX 文本到图像模型训练消融实验,以 1.2B 参数 PRX-1.2B 为基线,在 Flux VAE latent 空间、256×256 分辨率、全局 batch size 256 下训练 100k 步。
Gradio 团队发布开源 Python 库 Daggr,用于把 Gradio 应用、ML 模型和自定义函数串联成 AI 工作流,并自动生成可视化画布。它支持检查任意节点输出、修改输入并单独重跑某一步,还提供状态持久化和 sheets 多工作区,安装只需 Python 3.10 以上并执行 pip install daggr。
推荐理由:原文给出代码优先的编排方式和可视化画布,读者可据此判断它是否适合替代现有调试脚本。
Hugging Face 发布新工具 upskill,可用大模型生成并评测 agent skill,再交给更小或本地模型使用。文章以用 Claude Opus 4.5 编写 diffusers 模型 CUDA kernel 为例,upskill 会基于 agent trace 生成技能和测试用例,并对比有无技能时的准确率与 token 消耗。
推荐理由:原文给出用大模型生成并评测 agent skill 再迁移到小模型的完整流程,可复用到其他专业任务。
中国开源模型社区已近乎一致转向 MoE 架构,Kimi K2、MiniMax M2、Qwen3 均采用该路线,以在成本约束下兼顾能力与灵活部署。开源活动从文本扩展到多模态与智能体,StepFun 的 Step-Audio-R1.1 语音模型性能超越闭源模型,腾讯开源 Hunyuan Video 与 Hunyuan 3D。
Hugging Face 团队推出 Alyah(阿联酋方言中意为"北极星")基准,用于评估阿拉伯语 LLM 对阿联酋方言的语言、文化与语用理解能力。该基准包含 1,173 个由阿联酋母语者手工收集的多选题样本,覆盖问候语、诗歌、 heritage 知识等七类内容。
Hugging Face 博客复盘了用 verl 框架对 GPT-OSS 进行智能体强化学习训练时遇到的问题与修复。团队发现 GPT-OSS-20B 训练初期出现 KL 散度和熵爆炸、奖励不升,根因是 MoE 架构下双前向传播导致新旧 log-prob 不一致,使 PPO 的 importance sampling ratio 偏离 1;修复后该方案同样适用于 GPT-OSS-120B。
Hugging Face 发布 AssetOpsBench,一个面向工业资产运维的智能体评测基准,包含 2.3M 传感器遥测点、140+ 场景、4.2K 工单和 53 种结构化故障模式,覆盖 4 个智能体。
Hugging Face 发布系列博客第一篇,回顾 DeepSeek 于 2025 年 1 月发布 R1 模型一年来中国开源 AI 生态的变化。文章称 R1 通过公开推理路径与后训练方法、采用 MIT 许可,降低了技术、采用和心理三重门槛,并成为 Hugging Face 历史上获赞最多的模型。