Hugging Face 推出 AprielGuard:面向现代 LLM 系统的 8B 安全护栏模型
Hugging Face 发布 8B 参数安全护栏模型 AprielGuard,可检测 16 类安全风险及提示注入、越狱、思维链污染、记忆投毒、多智能体攻击等对抗攻击,并覆盖工具调用与推理轨迹等智能体工作流。模型提供推理与非推理两种模式,兼顾可解释分类与低延迟生产部署。训练数据由 Mixtral-8x7B 等合成生成,并借助 NVIDIA NeMo Curator 构建多轮对话攻击数据集。
Hugging Face 发布 8B 参数安全护栏模型 AprielGuard,可检测 16 类安全风险及提示注入、越狱、思维链污染、记忆投毒、多智能体攻击等对抗攻击,并覆盖工具调用与推理轨迹等智能体工作流。模型提供推理与非推理两种模式,兼顾可解释分类与低延迟生产部署。训练数据由 Mixtral-8x7B 等合成生成,并借助 NVIDIA NeMo Curator 构建多轮对话攻击数据集。
Transformers v5 重新设计了 tokenizer 的工作方式,将 tokenizer 架构与训练好的词表分离,类似 PyTorch 把网络结构与学习到的权重分开。新设计带来更清晰的内部结构、干净的类层级和单一快速后端,让 tokenizer 可检查、可定制、可从零训练。
NVIDIA 发布 Nemotron 3 Nano 30B A3B,并公开其完整评测配方,基于开源库 NeMo Evaluator 构建,任何人可复现评测流程并独立核查结果。
CUGA(Configurable Generalist Agent)是 IBM Research 推出的开源可配置通用智能体,采用 Apache 2.0 许可,现已集成到 Hugging Face Spaces 供试用。
llama.cpp server 新增 router 模式,可在不重启服务的情况下动态加载、卸载和切换多个模型,实现类似 Ollama 的模型管理。
推荐理由:llama.cpp server 新增 router 模式,读者可了解本地多模型动态加载与切换的具体用法和配置项。
Hugging Face 发布教程,展示如何让 OpenAI Codex 借助 Hugging Face Skills 仓库完成端到端模型微调实验。
推荐理由:原文给出可复用的 HF-skills 配置与端到端微调流程,读者可据此把训练实验交给编码智能体执行。
Hugging Face 推出 Swift 包 swift-huggingface,为 Hub 提供完整客户端,可独立使用,后续将并入 swift-transformers 替换现有 HubApi。它支持断点续传与进度追踪、与 Python 生态共享的缓存结构、TokenProvider 认证模式和 OAuth 2.0,Xet 存储后端支持即将上线。
Intel AI Software Group 推出 DeepMath,一个基于 Qwen3-4B Thinking 并用 GRPO 微调的数学推理 Agent,通过 smolagents 实现,让模型生成 Python 片段在沙箱中执行并回填结果。
Hugging Face 发布 Hugging Face Skills,其中 hf-llm-trainer 技能让 Claude Code、Codex、Gemini CLI 等编码智能体直接提交云端 GPU 训练任务、监控进度并把模型推送到 Hub。
推荐理由:原文给出 hf-llm-trainer 技能的安装命令与完整训练流程,读者可据此让编码智能体代跑微调任务。
Hugging Face 发布 Transformers v5.0.0rc-0,距 v4 首个候选版已五年,如今该库每天通过 pip 安装超过 300 万次,累计安装量超过 12 亿次。
推荐理由:官方梳理了 v5 在模型定义、训练、推理与量化上的取舍,可据此判断现有工作流是否需要迁移。
Hugging Face 发布博客,从注意力机制与 KV 缓存出发,推导出 continuous batching 这一推理优化技术。该方法通过并行处理多个对话、完成即换出,来最大化高负载场景下的吞吐量。文中指出注意力是 token 间唯一交互之处,其计算量随序列长度呈平方增长。
Hugging Face Diffusers 宣布支持 FLUX.2,并给出基于 diffusers/FLUX.2-dev-bnb-4bit 仓库的完整推理示例,transformer 与 Mistral3 文本编码器均以 bfloat16 加载并启用 CPU offload。
推荐理由:Diffusers 接入 FLUX.2 的示例代码与 4bit 量化仓库地址,可帮读者判断本地部署门槛与显存需求。
Tavily 分享了构建 SOTA 深度研究智能体的经验:七个月前其第一版架构因假设过于复杂,在下一代模型到来时成为瓶颈,团队被迫推倒重建。新方案简化编排逻辑、强调自主性,并借助 Tavily Advanced Search 在工具侧完成上下文工程,只返回最相关内容块以降低模型幻觉与延迟。团队还提出将工具输出蒸馏为反思、仅在生成最终交付物时注入原始信息,以模拟人类研究方式管理上下文窗口。
OVHcloud 成为 Hugging Face Hub 支持的 Inference Provider,用户可直接在模型页调用 gpt-oss、Qwen3、DeepSeek R1、Llama 等开源权重模型。
Hugging Face TRL 正式集成 RapidFire AI,用户可并发运行多个微调与后训练配置并近乎实时比较结果。RapidFire AI 通过自适应分块调度在单张 GPU 上同时跑多个配置,官方基准显示达到同等最佳训练 loss 的时间相比顺序比较提速 15 至 20 倍,并支持 SFT、DPO、GRPO 的 drop-in 配置与 MLflow 仪表盘上的停止、克隆、修改等操作。
Hugging Face 的 Open ASR Leaderboard 新增多语言与长音频转录赛道,并发布基于 60+ 模型的 ASR 趋势预印本。
AnyLanguageModel 是一个 Swift 包,作为 Apple Foundation Models 框架的 drop-in 替代,只需把 import FoundationModels 换成 import AnyLanguageModel 即可保持同一套 API。
ServiceNow 的 SLAM Lab 发布 Apriel-H1,把 15B 推理模型改造成 Mamba 混合架构,旗舰版 Apriel-H1-15b-Thinker-SFT 实现 2.1 倍吞吐且质量损失很小,MATH500 从 0.90 升到 0.92、MTBench 从 8.30 升到 8.58,GSM8k、GPQA、AIME24 略有下降。
推荐理由:ServiceNow 公开了把 15B 推理模型蒸馏成 Mamba 混合架构的完整流程与七个 checkpoint,可看到效率与质量的取舍曲线。
Hugging Face 的 kernels 库支持用 kernel-builder 构建并分享 ROCm 内核,可运行在 AMD GPU 上并集成进 PyTorch。指南以 RadeonFlow 的 FP8 GEMM 内核为例,该内核针对 AMD Instinct MI300X 优化,采用 e4m3fnuz 格式与分块缩放,曾获 AMD Developer Challenge 2025 大奖。
AMD、Hugging Face 与 Data Monsters 联合举办 AMD Open Robotics Hackathon,首站 12 月 5-7 日在东京,第二站 12 月 12-14 日在巴黎。
Hugging Face 宣布与 Google Cloud 建立更深层合作,让企业用开放模型构建自己的 AI。
Hugging Face 发布分析文章,指出中国开源权重模型的推理已开始由华为昇腾、寒武纪等国产芯片承载,部分模型开始用国产芯片训练。文章认为美国出口管制与中国芯片产能提速高度相关,芯片稀缺也促使 DeepSeek 的 MLA、GRPO 等算力效率创新走向开源。
推荐理由:梳理中国算力从被限制到自建全栈的路径,帮助读者理解开源模型与国产芯片如何互相推动。
NVIDIA 发布 Isaac for Healthcare v0.4,提供基于 SO-ARM 的端到端入门工作流,覆盖数据采集、训练与真机部署,可构建自主手术辅助机器人。
NVIDIA Isaac for Healthcare v0.4 发布基于 SO-ARM 的端到端入门工作流,覆盖数据采集、GR00T N1.5 后训练与真机部署,可构建自主手术助手机器人。
IBM 发布 Granite 4.0 家族中迄今最小的 Granite 4.0 Nano,面向边缘与端侧应用,含 4 个 instruct 模型及对应 base 版本。
Hugging Face 提出“语音同意门”机制,让语音克隆模型只有在说话人明确说出同意语句后才会启动。该方案由语言模型生成约 20 词的同意句与中性语音多样性句,经 ASR 识别同意内容后,再由 TTS 完成克隆,并建议同意音频直接来自麦克风而非上传文件。团队已提供示例 Space 和配套代码。
Hugging Face 发布 huggingface_hub v1.0,这是该库五年来的首个大版本,带来多项破坏性变更。主要变化包括底层从 requests 迁移到 httpx、文件传输全面改用 hf_xet 取代 hf_transfer,以及用基于 Typer 的 hf CLI 替换已弃用的 huggingface-cli。
推荐理由:官方梳理了 huggingface_hub v1.0 的破坏性变更与迁移路径,可据此评估自家依赖库的升级成本。
Hugging Face 发布 datasets 与 huggingface_hub 的流式加载改进,load_dataset(streaming=True) 接口保持不变即可获得性能提升。
推荐理由:官方给出流式加载的请求量、解析速度与吞吐变化,可据此判断大规模训练的数据管线是否值得切换。
Hugging Face 发布 LeRobot v0.4.0,带来 LeRobotDataset v3.0 分块 episode 格式与流式加载,支持 OXE 级别(> 400GB)数据集,并提供 lerobot-edit-dataset CLI 用于删除、拆分、合并数据集。
推荐理由:原文列出数据集、仿真环境、多 GPU 训练与硬件插件等具体变化,读者可据此判断开源机器人学习工具链的可用性。
Meta 与 Hugging Face 合作推出 OpenEnv Hub,一个面向智能体环境的开放共享社区平台,环境定义智能体完成任务所需的工具、API、凭证和执行上下文。
推荐理由:Meta 与 Hugging Face 联合推出智能体环境共享 Hub,并同步开放 0.1 规范 RFC,读者可据此了解智能体训练与部署的标准化路径。
Sentence Transformers 从 TU Darmstadt 的 UKP Lab 转由 Hugging Face 维护,Hugging Face 的 Tom Aarsen 自 2023 年底起已负责该项目并将继续领导。
Hugging Face 宣布与威胁情报平台 VirusTotal 合作,即日起对 Hub 上 220 万+ 公开模型和数据集仓库进行持续扫描。用户访问仓库或文件页面时,Hub 会自动将文件哈希与 VirusTotal 威胁情报库比对,返回检测数量、已知恶意关联等元数据,且不共享原始文件内容。组织可将 VirusTotal 检查集成到 CI/CD 或部署流程中,在下载或集成文件前识别恶意资产。
Hugging Face 发布指南,梳理 Chandra、OlmOCR-2、PaddleOCR-VL、DeepSeek-OCR、dots.ocr、Granite-Docling-258M。
推荐理由:梳理了当前开源 OCR 模型的输出格式、基准与本地部署方式,可据此为具体文档场景选型。
Hugging Face 为开源工具 AI Sheets 发布重大更新,新增视觉支持,可在表格中查看、分析图像并提取信息、生成和编辑图像,无需写代码。图像列支持提取文字、图像问答、目标检测、上色、添加文字等操作,文字列支持摘要、关键词提取和翻译,每个 AI 动作由提示词和模型定义,底层通过 Inference Providers 调用数千个开放模型。
Hugging Face 发起 AI for Food Allergies 项目,计划打造首个社区驱动的研究实验室,探索 AI 如何推进食物过敏研究。全球约 2.2 亿人患有至少一种食物过敏,美国约占总人口 10%。项目将连接前沿 AI 与生物医学,开发开放协作项目,服务研究者、临床医生与患者。
Intel 与 Hugging Face 联合测试显示,在搭载 Intel Xeon 6 处理器(Granite Rapids)的 Google Cloud C4 虚拟机上运行 OpenAI GPT OSS 大模型,总拥有成本(TCO)较上一代 C3 实例提升 1.7 倍,即 70%。
Hugging Face 博客给出用 Optimum Intel 和 OpenVINO 在 Intel CPU 上本地运行 SmolVLM2-256M-Video-Instruct 的三步流程:导出 OpenVINO IR、量化、推理。
NVIDIA 发布 Nemotron-Personas-India,首个对齐印度真实人口、地理与文化分布的开放合成 Indic 人设数据集,采用 CC BY 4.0 许可。
Hugging Face 发布 BigCodeArena,这是首个通过实际执行来评估代码生成模型的人类参与平台,支持 10 种语言和 8 种执行环境,可实时运行模型生成的代码并投票对比。平台自 2025 年 2 月上线以来已收集超 14,000 次对话、500 多名用户和 4,700+ 偏好投票,o3-mini 与 o1-mini 在 Elo 排名中持续领先。
Hugging Face 发布三部分系列文章,讲述如何将 RedNote 的 3B 参数 OCR 模型 dots.ocr 转换到端侧运行,该模型在 OmniDocBench 上超过 Gemini 2.5 Pro。