用 🤗 Transformers 微调 ViT 进行图像分类
Hugging Face 发布教程,演示如何用 🤗 datasets 加载 beans 图像分类数据集,并借助 🤗 transformers 微调预训练的 google/vit-base-patch16-224-in21k 模型。
Hugging Face 发布教程,演示如何用 🤗 datasets 加载 beans 图像分类数据集,并借助 🤗 transformers 微调预训练的 google/vit-base-patch16-224-in21k 模型。
Hugging Face Hub 上已有超过 215 个情感分析模型,用 Python 的 transformers pipeline 只需 5 行代码即可调用,默认模型对 "I love you" 和 "I hate you" 的预测置信度分别为 0.9998 和 0.9991。
Hugging Face 博客介绍了利用 Wav2Vec2 的 CTC 架构特性,通过带 stride 的重叠分块推理,让 ASR 在任意长音频上也能保持高质量识别。只需在 pipeline 中设置 chunk_length_s 和 stride_length_s,即可避免直接处理长文件时的显存溢出,该技巧同样适用于 LM 增强的 Wav2Vec2 模型,并可用于实时推理。
Hugging Face 为 huggingface_hub 库新增 ModelSearchArguments、DatasetSearchArguments 和 ModelFilter 类,让用户无需离开 Jupyter 或 Python 环境即可按任务、数据集、框架等条件搜索 Hub 上的模型和数据集。
Hugging Face 宣布将 PyTorch 深度强化学习库 Stable-Baselines3 集成到 Hugging Face Hub,用户可通过 pip install huggingface_sb3 上传和加载已保存的模型。
Hugging Face 公布 Infinity 在第三代 Intel Xeon 可扩展处理器(Ice Lake)上的端到端推理基准:为 DistilBERT 序列分类任务优化的容器相比同平台原生 Transformers 延迟与吞吐最高提升 800%,相比上一代 Cascade Lake 实例提升 34%。
🤗 Transformers 现已集成 Kensho Technologies 的 pyctcdecode 库,可将 n-gram 语言模型与微调后的 Wav2Vec2 检查点结合用于音频解码。
Hugging Face 发布教程,介绍如何用 Amazon SageMaker 和 Hugging Face Inference Toolkit 部署 GPT-J 6B 做实时推理,可在 NVIDIA T4 等常规 GPU 实例(约 500 美元/月)上运行。
Hugging Face 的 AutoNLP 与 Explosion 的标注工具 Prodigy 可组合成主动学习流水线:先用 Prodigy 对 BBC News 数据集做 NER 标注,约 20 条样本后即用 AutoNLP 训练模型。AutoNLP 支持二分类、多分类、token 分类、问答、摘要等任务,价格低至每模型 $10,本次多分类实验最佳模型准确率达 98.67%。
Hugging Face 收购机器学习初创公司 Gradio,Gradio 创始人以当事方身份宣布了这一消息。Gradio 于 2019 年由斯坦福博士生 Abubakar Abid 与室友 Ali Abdalla、Ali Abid、Dawood Khan 发布首版,从计算机视觉扩展到文本、语音和视频,至今已有超过 30 万个 demo 用它构建。
推荐理由:Gradio 创始人以当事方身份讲述被 Hugging Face 收购的经过,并回顾了这款开源库从 2019 年起步到 30 万 demo 的历程。
Hugging Face 宣布在 Transformers 库中加入 Perceiver IO,这是首个基于 Transformer、可处理文本、图像、音频、视频、点云等多种模态及其组合的神经网络。
推荐理由:Hugging Face 把 Perceiver IO 接入 Transformers,读者可了解这套统一处理文本、图像、音频、视频的架构如何落地调用。
Hugging Face 发布教程,介绍如何从零训练 GPT-2 大模型 CodeParrot,用于自动补全 Python 代码。
Hugging Face 发布 Accelerate 库,原文正文抓取失败,仅标题可用。