Diffusers 支持 Stable Diffusion 3.5 Large
Hugging Face 博客宣布 Diffusers 库已支持 Stable Diffusion 3.5 Large 模型。原文正文抓取失败,仅标题可用。
Hugging Face 博客宣布 Diffusers 库已支持 Stable Diffusion 3.5 Large 模型。原文正文抓取失败,仅标题可用。
Hugging Face 博客宣布 Llama 3.2 发布,Llama 现在可以看图并能在用户设备上运行。
Hugging Face 博客盘点了 Hub 上 5 个常被忽视的工具:ZeroGPU、多进程 Docker、Gradio API、Webhooks 和 Nomic Atlas。
Hugging Face Transformers 新增 DataCollatorWithFlattening,使无 padding 的 packing 训练与 Flash Attention 2 兼容,避免跨样本注意力。
Hugging Face 发布教程,介绍如何用 TGI 和专用深度学习容器(DLC)在 Google Cloud Vertex AI 的 A3 节点(8 张 H100 GPU)上部署 FP8 量化的 Meta Llama 3.1 405B Instruct。
Hugging Face 发布 ggml 入门指南,介绍这个用 C/C++ 编写、专注 Transformer 推理的开源 ML 库。ggml 核心库自包含在不到 5 个文件中,编译后二进制小于 1MB,支持 x86_64、ARM、Apple Silicon、CUDA 等硬件及量化张量。ollama、LM Studio、GPT4All 等项目均基于 ggml 实现端侧 LLM。
Hugging Face 在 Transformers 中推出统一的工具调用 API,同一套代码可在 Mistral、Cohere、NousResearch 和 Llama 等模型家族间通用,无需或只需极少模型专属改动。
推荐理由:原文给出了统一工具调用 API 的用法与完整示例,读者可据此把同一套代码迁移到多个模型家族。
阿布扎比技术创新研究院(TII)发布 Falcon Mamba 7B,采用纯 Mamba 架构并加入额外 RMS 归一化层以保证大规模训练稳定,以 TII Falcon Mamba 7B License 1.0 开放,可在 Hugging Face 生态中使用。
推荐理由:原文给出 Falcon Mamba 的架构取舍、训练数据与两组基准对比,可据此判断无注意力架构在长序列上的位置。
Hugging Face 宣布收购西雅图公司 XetHub,其 12 人团队将加入并帮助 Hub 从 Git LFS 切换到自研的存储与版本管理后端。XetHub 的分块存储与去重技术可让 10GB Parquet 文件只重传新增行所在的少量分块,GGUF 模型文件改一个元数据值也只需重传几 KB。
推荐理由:Hugging Face 收购 XetHub 并计划替换 Git LFS 存储后端,读者可了解 Hub 大文件版本管理将如何变化。
Hugging Face 与 Albumentations AI 合作推出面向文档图像的 TextImage 数据增强管线,可同时修改图像内容与文本标注。该管线支持随机插入、删除、交换及停用词替换等文本增强,并通过黑化与 inpaint 保持文字质量,用于 VLM 微调。代码已开源,可通过 pip install albumentations 使用。
Hugging Face 于 8 月 6 日梳理了 Hub 的安全功能,面向所有用户提供细粒度 Token、2FA、Commit Signing、组织访问控制,以及基于 ClamAV、picklescan、trufflehog 的自动化安全扫描流水线。Enterprise Hub 用户还可使用 SSO(支持 SAML 2.0 与 OIDC)和 Resource Groups 等高级控制。
Google 在 Gemma 2 发布一个月后扩充模型家族,新增 2.6B 参数的 Gemma 2 2B(含 base 与指令微调版)、安全分类器系列 ShieldGemma 以及覆盖 Gemma 2 2B 和 9B 每一层的稀疏自编码器套件 Gemma Scope。
推荐理由:Google 一次性放出 Gemma 2 2B、ShieldGemma 与 Gemma Scope,读者可据此了解小模型端侧部署与安全过滤的配套方案。
Hugging Face 展示了如何借助 Diffusers 库中的 Quanto 量化工具降低 Transformer 扩散模型的内存占用。以 PixArt-Sigma、Stable Diffusion 3 和 Aura Flow 为例,将扩散主干与文本编码器量化为 FP8 后,SD3 推理显存从 16.403 GB 降至 8.204 GB,质量几乎无损但延迟略有上升。
Hugging Face 面向 Enterprise Hub 组织推出 NVIDIA NIM API(无服务器),可在 Hub 内用 OpenAI 标准 API 对 Llama、Mistral 等开源模型运行推理。
Hugging Face 提出 LAVE(LLM-Assisted VQA Evaluation)指标,用 Llama-2-Chat-7b 以 1-3 分制对候选答案打分,在 Docmatix 的 200 张图像子集上评估 MPLUGDocOwl1.5 的零样本表现。
Meta 发布 Llama 3.1 系列,包含 8B、70B、405B 三个尺寸的 base 与 instruct 版本共六个开放权重模型,均支持 128K token 上下文和英语、德语、法语、意大利语、葡萄牙语、印地语、西班牙语、泰语 8 种语言,并新增工具调用能力。
推荐理由:Hugging Face 官方梳理了 Llama 3.1 三个尺寸的显存需求、量化方案与微调路径,可据此估算部署成本。
Hugging Face 发布教程,介绍如何借助 WWDC 24 的新 Core ML 特性在 Mac 上运行 Mistral 7B,并用 4-bit 分块量化把模型压到约 3.8G,低于 float16 转换的 14G。
Mistral AI 与 NVIDIA 联合发布 12B 模型 Mistral NeMo,支持最高 128k tokens 上下文窗口,以 Apache 2.0 许可开放预训练基座和指令微调 checkpoint。
推荐理由:Mistral 与 NVIDIA 联合发布的 12B 模型给出 128k 上下文和 Apache 2.0 权重,读者可据此判断它能否直接替换现有 Mistral 7B 部署。
Hugging Face 为 TGI 推出 Multi-LoRA 服务,只需部署一次基础模型,即可按请求中的 adapter_id 动态调用多个 LoRA 适配器。
推荐理由:Hugging Face 官方给出 TGI Multi-LoRA 的部署步骤与成本数据,读者可据此评估单次部署承载多适配器的可行性。
Hugging Face 发布 Docmatix,一个包含 240 万张图像、950 万问答对(源自 130 万份 PDF)的文档视觉问答数据集,规模是此前数据集的 240 倍。
Mistral AI 发布 Codestral Mamba,这是一个基于 Mamba 架构的代码模型,具备线性时间推理能力,权重以 Apache 2.0 许可开放下载。
推荐理由:Mamba 架构在代码场景的落地样本,线性时间推理与 256k token 检索测试给出了与 Transformer 路线对比的具体参照。
Mistral AI 发布专攻 STEM 的数学推理模型 Mathstral 7B,基于 Mistral 7B,在 MATH 上得分 56.6%、MMLU 上得分 63.47%。
这篇教程展示了如何用 distilabel 为 Argilla 2.0 构建能理解技术文档的聊天机器人:先从 GitHub 文档生成合成数据集并微调领域专用嵌入模型,再搭建向量数据库存储和检索文档。最终聊天机器人部署在 Hugging Face Space 上,交互记录存入 Argilla 用于持续评估与改进。
Hugging Face 发布 SmolLM 系列小语言模型,包含 135M、360M 和 1.7B 三个参数尺寸,并同步开源训练语料 SmolLM-Corpus。
推荐理由:原文公开了 SmolLM 三个尺寸的训练数据配方与评测对比,可据此判断小模型在端侧的表现边界。
Numina 与 Hugging Face 合作的 NuminaMath 7B TIR 赢得首届 AIMO 进步奖,在私有测试集 50 题中解出 29 题。方案基于 DeepSeekMath-Base 7B 做两阶段微调,先学自然语言链式推理,再用 GPT-4 生成的工具集成推理数据训练模型调用 Python REPL。
推荐理由:NuminaMath 团队复盘了夺冠方案的两阶段微调、SC-TIR 解码与内部验证集设计,可供做数学推理微调的人参考。
Hugging Face 的 TRL 库现已支持视觉语言模型(VLM)的直接偏好优化(DPO),并提供了完整训练教程。示例使用 Idefics2-8b 模型和包含超 83,000 条标注的 openbmb/RLAIF-V-Dataset 数据集,该 DPO 实现同时支持 Llava 1.5 和 PaliGemma。
Hugging Face 正在 Dataset Hub 上试验一项基于开源 PII 检测工具 Presidio 的新功能,可为数据集生成 PII 存在情况的估算报告。Presidio 依靠检测模式和机器学习模型识别 PII,报告可帮助开发者在训练前决定是否进一步过滤数据,也便于数据集所有者在上线前验证自己的 PII 过滤流程。
Hugging Face 与 KerasHub 实现共享模型保存格式,Hub 上 30 万+ Transformers 模型现可直接加载进 KerasHub,首批支持 Gemma 1/2、Llama 3 和 PaliGemma。
Banque des Territoires、Polyconseil 与 Hugging Face 合作,为法国 EduRénov 校园生态改造计划搭建基于 RAG 的主权数据方案,项目第一阶段已完成。
Hugging Face 宣布 Google Cloud TPU v5e 正式上线 Inference Endpoints 和 Spaces,提供 v5litepod-1(1 核 16 GB,$1.375/小时)、v5litepod-4(4 核 64 GB,$5.50/小时)和 v5litepod-8(8 核 128 GB,$11.00/小时)三种配置。
Hugging Face 为 Dataset Hub 的数据集搜索新增按模态、大小、格式和库四项筛选功能,可按文本、图像、音频等模态及最小/最大行数过滤,超过 10B 行的数据集也能被检索到。
Intel 与 MILA 将多模态蛋白质语言模型 ProtST 重新架构并发布在 Hugging Face Hub,借助 Optimum for Intel Gaudi 库可在 Gaudi 2 上以极少代码改动运行。
Hugging Face 用 Transformers Agents 构建的 Code Agent 在 GAIA 基准验证集上取得 44.2%,排名第一,比第二名高 4 分;测试集得分 33.3%,排名第二,并在 Level 3 难题上取得最佳平均分。
推荐理由:原文公开了 Code Agent 在 GAIA 上的完整实现细节与得分,可据此了解代码动作相对 动作的取舍。
Google 发布 Gemma 2 系列开源大模型,包含 9B 和 27B 两个尺寸的基座版与指令微调版共 4 个开放权重模型,上下文长度 8K tokens,采用允许商用和再分发的宽松许可。
推荐理由:梳理 Gemma 2 的滑窗注意力、软截断与蒸馏等训练细节,并给出与 Llama 3、Qwen 1.5 的基准对比。
XLSCOUT 发布专有嵌入模型 ParaEmbed 2.0,基于高质量多领域专利数据微调,准确率较 2023 年 10 月发布的 ParaEmbed 1.0 提升 23%。
Hugging Face 发布《伦理与社会通讯 #6》,聚焦高质量数据对 AI 模型的决定性作用,指出好数据不只是准确或量大,而是契合具体用途。文章以 Reddit 与 Google 的 RAG 搜索合作为例,说明低质数据曾导致“在披萨里加胶水”这类荒谬推荐。文中列出相关性、全面性、时效性与偏见缓解等数据质量维度,并强调数据治理、去重、内容过滤与人工反馈等流程。
Hugging Face 与 Argilla 合作的 Data Is Better Together 计划已产出 DIBT/10k_prompts_ranked 数据集,由 385 人参与完成 1 万条合成与人工提示词的质量排序,并被用于训练 SPIN 等新模型。
Prezi 加入 Hugging Face Expert Support Program,将更小更高效的开源模型整合进其 ML 工作流,用于 Prezi AI 演示文稿生成。
Hugging Face 发布 BigCodeBench,一个面向大语言模型代码生成的新基准,包含 1,140 个函数级任务,需调用来自 139 个库的多个函数,每项任务平均含 5.6 个测试用例、分支覆盖率平均 99%。
Hugging Face Accelerate 在 0.30.0 版本中为 FSDP 加入自动 upcasting,使其在混合精度下与 DeepSpeed 行为对齐。