跳到正文

#Hugging Face

今日 0 条
10月4日周日
  1. Hugging Face Blog71

    微软与 Hugging Face 发布 ThinkingBox:按数据库终态而非生成文本给 AI 智能体打分

    微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,按终端后端状态和副作用而非生成文本打分,覆盖 507 个有状态业务流程、每个任务重复运行 20 次。

    推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用 507 个有状态工作流和 20 次重复运行,把工具调用成功率与数据库终态正确率区分开来。

10月2日周五
  1. Hugging Face Blog38

    ServiceNow CoreAI 的 AutoSynthData 如何为企业智能体生成训练数据

    ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败与更强教师的成功来定位能力缺口,并生成、验证新的可执行训练任务,课程随模型进步向仍难的任务迁移。该方法以 EnterpriseOps Gym 数据集演示,任务由系统规范、用户提示词和验证器三部分组成,需满足可行性、真实性与难度要求。

9月30日周三
9月29日周二
  1. Hugging Face Blog62

    NVIDIA 发布 Kumo Tabular 表格基础模型,在四个基准排名第一

    NVIDIA 发布开源表格基础模型 Kumo Tabular,给定带标签的表格行即可在单次前向传播中预测新行标签,无需训练、调参和特征工程,同时支持分类与回归。

    推荐理由:原文给出模型规模、训练数据来源与四个基准排名,可据此判断表格基础模型相对梯度提升树路线的差异。

  2. Hugging Face Blog38

    ProvenanceGuard:面向 MCP 智能体的来源感知事实核查

    Hugging Face 博客介绍论文 ProvenanceGuard,一个面向 MCP 智能体的生成后验证层,专门检测"跨来源混淆"——即事实在证据池中为真、却被归给错误来源。在 281 条医疗智能体真实 trace 上,专家判定 361 条 claim 中 139 条不应通过,ProvenanceGuard 拦下 138 条,并在可识别来源的 claim 上约 86% 选对来源。

9月28日周一
  1. Hugging Face Blog72

    H公司发布 Holo4 系列智能体模型,含 27B 与 35B-A3B 两个版本

    H公司发布 Holo4 系列智能体模型,包含 27B dense 与 35B-A3B Mixture of Experts 两个版本,均已上线 H Models API,权重以 BF16、FP8、NVFP4 和 4-bit GGUF 形式开源在 Hugging Face,同时发布 Holotron4 Nano。

    推荐理由:Holo4 同时覆盖 GUI、代码、MCP 与 API 四种接口,并公开全部评测轨迹,可据此判断通用计算机操作智能体的路线取舍。

  2. Hugging Face Blog60

    Hugging Face Hub 上线 RL Environments 专区

    Hugging Face Hub 新增 RL Environments 专区,用带 rl-environment 标签的 dataset 仓库承载强化学习环境,不引入新仓库类型或注册表。

    推荐理由:原文说明了用数据集标签替代独立注册表的做法,读者可据此判断它如何简化跨框架的环境复用。

9月24日周四
9月22日周二
  1. Hugging Face Blog35

    oMLX 作者 Jun Kim 加入 Hugging Face,支持 MLX 社区

    oMLX 创作者兼维护者 Jun Kim 加入 Hugging Face,全职投入 MLX 社区建设。oMLX 将保持 Apache 2.0 开源协议并由 Jun 继续领导,从副业项目转为有资金支持的长期项目,以获得更好的稳定性和更快的开发速度。Hugging Face 希望 oMLX 成为新想法的试验场,并推动 transformers 模型定义快速转化为可供不同引擎使用的 MLX 参考实现。

9月21日周一
9月16日周三
9月10日周四
  1. Hugging Face Blog60

    Hugging Face 用 Gradio Workflow 重建 AUTOMATIC1111 图像管线

    Hugging Face 发布 Workflow1111,用 Gradio Workflow 把 AUTOMATIC1111 的大部分功能重建为一张包含 11 条媒体管线和 73 个节点的画布,覆盖文生图、高清修复、图生图、提示词矩阵、VLM 反推、检测生成 inpaint 掩码、ControlNet 风格标注器、背景移除、PNG Info 与图生视频。

    推荐理由:原文完整拆解了 73 节点画布如何复刻 A1111 的十一类图像管线,可据此迁移到自建多模型工作流。

9月3日周四
9月2日周三
9月1日周二
  1. Hugging Face Blog62

    Hugging Face 发布 @huggingface/kernels:207 个 WebGPU kernel 与 Fleet 基准工具

    Hugging Face 发布 @huggingface/kernels,一个从 Hugging Face Hub 加载并运行优化 WebGPU kernel 的 JavaScript 库,同时上线 207 个 kernel 的初始集合,均以 Apache-2.0 许可发布在 webgpu-kernels 组织下。

    推荐理由:原文给出 207 个 WebGPU kernel 的发布结构、加载方式与对比数据,可据此判断浏览器端推理的优化路径。

8月28日周五
  1. Hugging Face Blog36

    Hugging Face Open ASR Leaderboard 新增首个全球南方语言:印地语与印度英语评测集 Monsoon

    Hugging Face 与 Voice Arena 合作,在 Open ASR Leaderboard 上新增 Monsoon en-IN 和 Monsoon hi-IN 两个评测集,印地语成为该多语言榜单上首个 Indic 语言。四个公开/私有 split 共覆盖 4,888 名说话人,每人记录 12 项属性,且说话人不重叠;印地语集采用 lattice 标注以容纳多种可接受的拼写变体。

8月26日周三
8月25日周二
  1. Hugging Face Blog62

    Multiverse Computing 提出 Quantization-Aware Healing,4-bit 压缩模型在 7/9 基准上超过其 bfloat16 版本

    Multiverse Computing 发布论文《Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs》,提出 QAH 方法:在结构压缩并量化后,直接从压缩前的原始模型蒸馏,而非从恢复出的 bfloat16 检查点蒸馏。

    推荐理由:论文给出压缩加量化后从原始模型蒸馏的恢复配方,并附9项基准对比与QAT稳定性差异。

8月21日周五
  1. Hugging Face Blog62

    Hugging Face 研究:语音识别模型存在基准优化问题

    Hugging Face 发布研究,用共识分歧、掩蔽实体检索和拼写切换三项探针量化语音识别中的基准优化现象,评测 11 个开源 ASR 模型。结果显示,部分高分模型会在音频与参考文本矛盾时复现基准的错误转写,VoxPopuli 分析样本中约 40% 的片段被标记出参考错误,涉及约 3% 的参考词,这类模型复现错误参考的比例为 18–30%。

    推荐理由:通过三项探针量化语音模型对基准的过拟合,并给出可复用的检测脚本与榜单入口。

  2. Hugging Face Blog60

    Liquid AI 发布 LFM2.5-DSpark 草稿模型,推理最高提速 3.2 倍

    Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 草稿模型检查点,通过投机解码在 GPU 上最高提升 3.18 倍吞吐、端侧最高 2.87 倍,且不改变输出质量。

    推荐理由:Liquid AI 给出三款 LFM2.5 草稿模型的实测吞吐与函数调用延迟数据,可据此判断端侧推理的可用性。

8月19日周三
  1. Hugging Face Blog62

    ALTK-Evolve 研究:智能体到底需要多少记忆

    IBM Research 在 Hugging Face 博客发布 ALTK-Evolve 研究,用 AppWorld 的 585 个多步任务评测八款模型,发现智能体记忆不是开关而是需要按模型校准的剂量。

    推荐理由:八模型对比给出了智能体记忆的三种剂量模式与 token 开销数据,可据此判断自家模型该用全量还是检索式注入。

8月18日周二
  1. Hugging Face Blog62

    Sentence Transformers v6.0 新增 MultiVectorEncoder,支持 ColBERT 式后期交互检索

    Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,用于 ColBERT 式后期交互检索,PyLate、Stanford-NLP ColBERT 检查点可直接加载,colpali-engine 的视觉文档检索模型也可通过同一 API 使用。

    推荐理由:原文给出多向量编码器的加载、打分与索引接入方式,读者可据此判断现有检索栈的改造量。

  2. Hugging Face Blog34

    同一集群利用率提升 33 个百分点:Hugging Face 约束感知 GPU 调度器如何改变分配顺序

    Hugging Face 构建了约束感知的 GPU 分配器,在相同硬件和负载下对比 FIFO 调度器,七个基准场景中 GPU 利用率最高提升 33 个百分点,优先级加权产出最高提升 105%。在五个真实争用场景中,利用率从 52–85% 提升至 72–88%,优先级加权价值平均提升 52%。核心变化不在硬件,而在于分配决策的顺序:实时推理按需求曲线逐时间步分配,批式任务按优先级跨整个调度周期排布。

8月14日周五
8月13日周四
  1. Hugging Face Blog68

    Hugging Face 用智能体复现 2226 篇 ICML 论文

    Hugging Face 在 7 月 15 日至 8 月 2 日举办 ICML 2026 开放复现挑战,1221 名社区成员用 Claude Code、Codex、Cursor 等编码智能体逐条复现论文,共发布 6816 份 Trackio logbook,覆盖 2226 篇论文,占全部录用论文的 34%。

    推荐理由:Hugging Face 公开了 2200 余篇 ICML 论文的复现结果与判定数据,可据此了解智能体参与科研复现的可行边界。

8月11日周二
  1. Hugging Face Blog62

    NVIDIA 发布 Magpie TTS 多语言语音模型,开放权重支持 12 种语言

    NVIDIA 发布 Magpie TTS Multilingual 开放权重模型,参数量 364M,支持英语、西班牙语、法语、德语、意大利语、越南语、普通话、印地语、日语等 12 种语言,新增现代标准阿拉伯语、韩语和巴西葡萄牙语。

    推荐理由:NVIDIA 公开 Magpie TTS 多语言模型的权重与延迟数据,读者可据此评估自建语音链路的可行性与成本。

8月10日周一