Hugging Face Inference Endpoints 如何用自定义 handler 实现 Whisper ASR + 说话人分离 + 推测解码
Hugging Face Inference Endpoints 通过自定义 inference handler,把 Whisper ASR、Pyannote 说话人分离和推测解码组合在单个 API 端点中。
Hugging Face Inference Endpoints 通过自定义 inference handler,把 Whisper ASR、Pyannote 说话人分离和推测解码组合在单个 API 端点中。
Hugging Face 推出 Open Medical-LLM Leaderboard,用统一平台评测大语言模型在医疗任务上的表现,以准确率为主要指标,覆盖 MedQA、MedMCQA、PubMedQA 及 MMLU 医学与生物学子集。
Mistral 发布最新开源模型 Mixtral 8x22B,采用稀疏 Mixture-of-Experts 架构,141B 参数中仅激活 39B,以 Apache 2.0 许可开放。
推荐理由:原文给出 Mixtral 8x22B 的激活参数、上下文窗口与开源许可,读者可据此判断其成本与部署取舍。
Ryght 正式发布面向生命科学知识工作者的免费安全平台 Ryght Preview,并借助 Hugging Face 专家支持计划加速其企业级生成式 AI 平台开发。
Hugging Face 发布视觉语言模型入门指南,梳理了 LLaVA 1.6、CogVLM、Qwen-VL、Fuyu-8B、KOSMOS-2 等开源 VLM 的模型规模、图像分辨率与 grounding 等能力,并介绍 Vision Arena、Open VLM Leaderboard 及 MMMU、MMBench 等评测基准。
Hugging Face 推出 Deploy on Google Cloud,可将 Hub 上数千个基础模型一键部署到 Google Cloud 的 Vertex AI 或 GKE,并作为自有账号内的 API Endpoint 运行。
Google 发布 CodeGemma 系列开源代码模型,包含 2B 基础模型、7B 基础模型和 7B Instruct 三个版本,基于预训练的 2B 和 7B Gemma checkpoint 额外训练 5000 亿 token 的英文、数学和代码数据。
推荐理由:Google 与 Hugging Face 联合发布三个开源代码模型,读者可对照 HumanEval 等基准数据判断其与同尺寸模型的差距。
Hugging Face 宣布与云安全公司 Wiz 合作提升平台及 AI/ML 生态安全,并已集成 Wiz 进行漏洞管理和云安全态势管理(CSPM)。Wiz 研究团队通过 pickle 在沙箱计算环境中运行任意代码,发现了相关缺陷,Hugging Face 表示已修复全部漏洞。
借助 🤗 Optimum Intel 对 SetFit 模型做训练后静态量化,可在 Intel Xeon CPU 上把推理速度提升 7.8 倍,实现生产级部署。
Hugging Face 发布面向非技术人群的 Transformers 入门指南,无需 Python 基础即可理解开源机器学习基础。教程以在 Hugging Face Space 的 JupyterLab notebook 中运行微软 Phi-2 LLM 为例,需租用 NVIDIA A10G Small GPU(24GB 显存,每小时几美元)。
Hugging Face 发布 Cosmopedia,一个由 Mixtral-8x7B-Instruct-v0.1 生成的合成预训练数据集,包含超 3000 万个文件、250 亿 token,并开源了端到端流水线代码、数据集和基于它训练的 1B 模型 cosmo-1b。
推荐理由:原文完整公开了从提示词构建到去污染的合成数据流水线,可据此复现或迁移到自有预训练数据生产。
Argilla 与 Hugging Face 推出 Data is Better Together 实验,几天内吸引 350 名社区贡献者完成超 11,000 条 prompt 评分,并发布含 10,000 条 prompt 用户评分的 10k_prompts_ranked 数据集。
Hugging Face 发布教程,展示如何用 Optimum Habana 的自定义 pipeline 类在 Intel Gaudi 2 AI 加速器上运行 Llama 2 系列模型(7b、13b、70b)进行文本生成。
Hugging Face 发布 TTS Arena,借鉴 LMSys 的 Chatbot Arena,让用户输入文本、对比两个 TTS 模型的合成语音并投票选出更自然的一方。首批上线模型包括 ElevenLabs、MetaVoice、OpenVoice、Pheme、WhisperSpeech 和 XTTS,投票结果将汇总到采用类 Elo 算法排名的公开排行榜。
Google 发布新的开源大语言模型 Gemma,Hugging Face 博客以“欢迎 Gemma”为题介绍了该模型。
Hugging Face 发布博客欢迎 Mixtral 上线,称其为 SOTA 混合专家模型。
Mistral AI 发布首个 7B 参数模型 Mistral 7B,称其在所有标准英文与代码基准上超过当时所有 13B 参数以下的开源模型,并以 Apache 2.0 许可发布,可无限制使用。
推荐理由:Mistral AI 首次公开其开源路线与 Mistral 7B 的基准表现,可了解开放权重模型当时的性能位置。
Mistral AI 发布 7.3B 参数的 Mistral 7B,采用 Apache 2.0 许可,可无限制使用并支持本地、云端(AWS/GCP/Azure)及 HuggingFace 部署。
推荐理由:Mistral 7B 以 Apache 2.0 开源并给出与 Llama 2 系列的逐项对比,读者可据此判断小参数模型的性价比位置。
Hugging Face 发布 Falcon 180B 模型。
Hugging Face 发布 IDEFICS,一个对先进视觉语言模型的开源复现。
Hugging Face 开源了 SD-Small 和 SD-Tiny 的知识蒸馏代码与模型权重。
Hugging Face 博客发布消息称 Llama 2 已发布,并可在 Hugging Face 上获取。原文正文未能抓取,除标题外暂无更多细节。
Hugging Face 发布博客宣布 Falcon 模型已落地 Hugging Face 生态。原文正文抓取失败,仅标题可用,暂无更多细节。
Hugging Face 发布面向代码的大语言模型 StarCoder,标题称其在代码任务上达到当时的最先进水平。
Hugging Face 发布 StackLLaMA 实操指南,介绍如何用 RLHF 训练 LLaMA。
Hugging Face 博客发布 ControlNet in 🧨 Diffusers,宣布 ControlNet 接入 Diffusers 库。
Hugging Face 发布教程,讲解如何用 🤗 Transformers 对 Whisper 进行微调,以适配任意多语言 ASR 数据集。Whisper 由 OpenAI 于 2022 年 9 月发布,基于 68 万小时标注音频预训练,覆盖 96 种以上语言,并提供 tiny 到 large-v3 共 11 个 checkpoint。
Hugging Face 将 Intel OpenVINO 加入 Optimum Intel,用户可在多种 Intel 处理器上用 OpenVINO Runtime 对 Transformers 模型执行推理,模型可托管于 Hugging Face hub 或本地。
Hugging Face 分享了 BLOOM(176B 参数、bf16 下 352GB)推理服务的优化过程,数周内将延迟降低 5 倍、吞吐提升 50 倍。
Hugging Face 宣布用户可直接在 Hub 上为模型或数据集生成 DOI,该功能已与 DataCite 合作实现。注册用户填写必要元数据后即可获得 DOI,他人可通过模型或数据集页面上的“Cite this model/dataset”按钮引用其工作。带 DOI 的数据集和模型将被永久保留,仅可在向官方支持提交请求后删除。
rinna 通过对 Stable Diffusion 进行微调,开发出支持日语提示词的文本生成图像模型 Japanese Stable Diffusion,模型已在 Hugging Face 和 GitHub 发布,代码基于 🧨 Diffusers。
Hugging Face 的 Accelerate 利用 PyTorch 的 meta device 先创建无权重空模型,再逐层加载权重并按设备映射分配,从而在内存和单卡显存不足时也能运行超大模型。
Hugging Face 与 Intel Labs、UKP Lab 合作推出 SetFit,一个面向 Sentence Transformers 的高效少样本微调框架,无需提示词或 verbaliser。
推荐理由:原文给出 SetFit 的两阶段训练流程与 RAFT 基准对比,读者可了解无提示词少样本分类的实现方式与成本。
Hugging Face 推出《Ethics and Society Newsletter》,按季节在春分秋分和夏至冬至发布,由公司内部跨部门开放小组“Ethics and Society regulars”撰写。
OpenAI 训练并开源了神经网络 Whisper,其在英语语音识别上接近人类水平的鲁棒性和准确度。
推荐理由:OpenAI 开源语音识别模型 Whisper,读者可了解其在英语识别上的鲁棒性与准确度定位。
Hugging Face 发布教程,展示如何用 DeepSpeed-Inference、Accelerate 和 DeepSpeed ZeRO 为 176B 参数的 BLOOM 模型做推理,并给出各方案在 8x80GB A100 上的吞吐与加载耗时基准。
推荐理由:文章给出 BLOOM 176B 在多种 GPU 配置下的吞吐与加载耗时对比,可据此选择部署方案。
Hugging Face 发布 diffusers 0.3,为扩散模型工具箱新增图生图 pipeline、文本反转、实验性 inpainting pipeline、ONNX 导出器与 Mac 支持。其中显存优化让 Stable Diffusion 只需 3.2GB 显存,代价是约 10% 的速度损失;文本反转支持用 3-5 张样本个性化模型,社区几天内分享了 200 多个概念。
推荐理由:梳理 diffusers 0.3 新增的图生图、文本反转、inpainting 与显存优化,可据此判断扩散模型工具链的可用边界。
Hugging Face 发布教程,教你用 transformers 库从零训练一个离线 Decision Transformer,让 HalfCheetah 在 Gym 环境中奔跑。
RAIL Initiative 推出、Hugging Face 支持的 OpenRAIL 是一类 AI 专用许可框架,允许免版税访问、下游使用与再分发,同时嵌入针对特定关键场景的使用限制。该许可借鉴 BigScience、开源与 Creative Commons 的做法,试图在广泛开放 ML 模型与约束有害用途之间划出界线,并赋予许可方在发现滥用时的执行能力。
Hugging Face 发布教程,介绍如何用 3Dmol.js 和 Gradio 的 HTML 组件在 Hugging Face Spaces 中可视化蛋白质结构。用户可输入 4 位 PDB 代码或上传 PDB 文件,应用会从 RCSB Protein Databank 获取结构并渲染。文章还提到可用 Molecule3D Gradio 自定义组件简化这一流程。