Hugging Face Hub 迎来 fastai 集成:一行 Python 上传模型
fastai 用户现在可以用一行 Python 将模型上传至 Hugging Face Hub,并通过 from_pretrained_fastai 直接加载他人模型。
fastai 用户现在可以用一行 Python 将模型上传至 Hugging Face Hub,并通过 from_pretrained_fastai 直接加载他人模型。
Hugging Face 推出免费深度强化学习课程,第一单元讲解深度强化学习基础,涵盖强化学习框架、马尔可夫性质、策略与价值方法等核心概念。课程使用 Stable Baselines3、RL Baselines3 Zoo 和 RLlib 等库,并让学员训练首个登月着陆器智能体并上传至 Hugging Face Hub。
Hugging Face 展示如何用 Accelerate 库无需改代码即可调用 PyTorch 的 FullyShardedDataParallel(FSDP)训练大模型。
HuggingFace AutoTrain 与数据标注平台 Kili 可组合成文本分类的主动学习流水线,实现数据清洗、模型选择和超参数优化的全自动。示例用 Google Play 上约 4 万条 Medium 用户评论,在 Kili 中按 Subscription、Content、Interface、User Experience 四类标注,再对分类结果做情感分析。
Hugging Face 与 Habana Labs 合作,展示如何在 AWS EC2 DL1 实例(搭载 8 颗 Habana Gaudi 处理器)上微调 BERT 模型。
Hugging Face 发布教育计划,目标到 2023 年底教会 500 万人机器学习。该计划面向所有人、初学者和教师三类人群,提供 NLP、深度强化学习、Gradio 演示构建等免费课程,以及翻译成 8 种语言的免费教学工具包,教师可在 Hub 上免费创建课堂。此前 2022 年 3 月的 ML demo.cratization 巡讲已为 16 个国家超 1000 名学生授课。
Hugging Face 发布博客,演示如何用其生态工具处理客户服务场景:将筛选最不满客户消息建模为文本分类任务,分为 very unsatisfied 到 very satisfied 五类。
Hugging Face 为 huggingface_hub 库新增 emissions_threshold 参数,可按训练碳排放量筛选 Hub 上的模型,例如筛选出 191 个排放不超过 100 克的模型。transformers 则通过集成 codecarbon,在 Trainer 训练时自动记录碳排放并生成 emissions.csv,方便开发者将数据填入模型卡。
Hugging Face 机器学习工程师 Lewis Tunstall 在访谈中介绍了与 Leandro von Werra 合著的《NLP with Transformers》,并讲述了自己从 2018 年使用 pytorch-pretrained-bert 到加入 Hugging Face 的经历。
Habana Labs 与 Hugging Face 宣布合作,将 Habana 的 SynapseAI 软件套件与 Hugging Face Optimum 开源库集成,开发者只需几行代码即可在 Habana 处理器上加速 Transformer 训练。
Hugging Face 的 Transformers 库有意不遵循 DRY 原则,转而采用“单模型文件”策略:模型前向传播所需的全部代码只放在一个模型文件中,注意力机制代码因此被复制到 50 多个模型文件里。官方给出的理由包括该库由开源社区共建、建模代码本身就是产品、机器学习领域演进极快,以及模型发布后基本不再改动。
Hugging Face 将离线强化学习方法 Decision Transformer 集成进 transformers 库和 Hugging Face Hub,并发布 9 个 Gym 环境连续控制任务的预训练 checkpoint,覆盖 Hopper、Walker2D 和 Halfcheetah,Atari 环境 checkpoint 即将推出。
Hugging Face 发布机器学习专家访谈,嘉宾 Margaret Mitchell 讲述其从微软 Seeing AI 到创立 Google 伦理 AI 团队、再到加入 Hugging Face 的经历。
Hugging Face 推出为期 9 个月的 AI Research Residency Program,入选者将与 Science Team 研究员共同选定研究课题、开发新的机器学习技术,并以开放协作方式推进成果发表。项目为全职岗位,可远程参与,申请截止日期为 2022 年 4 月 3 日。
Hugging Face 发布教程,演示如何用 transformers 库微调 SegFormer 语义分割模型,并以自建的 segments/sidewalk-semantic 人行道数据集训练披萨配送机器人识别路面。教程覆盖从 Hub 加载数据集、用 SegformerImageProcessor 与 ColorJitter 做数据增强,到按 B0 至 B5 五种规模微调模型的完整流程。
Hugging Face 发布端到端教程,演示如何用 Hugging Face Transformers、Amazon SageMaker 和 AWS Inferentia 加速 BERT 文本分类推理。
Hugging Face 的 🤗 datasets 现已支持图像特征类型,可结合 sentence_transformers 和 faiss 为图像数据集构建相似度搜索应用。文中以英国图书馆数字化书籍插图数据集为例,通过 ImageFolder 加载器直接载入含 image 和 label 特征的 10000 行数据,并利用 datasets 内置的 faiss 索引能力实现图像检索。
Hugging Face 在 Transformers 中推出约束束搜索(constrained beam search),通过 model.generate() 的 force_words_ids 参数强制输出包含指定词。
Hugging Face 发布教程,演示如何用 🤗 datasets 加载 beans 图像分类数据集,并借助 🤗 transformers 微调预训练的 google/vit-base-patch16-224-in21k 模型。
Hugging Face Hub 上已有超过 215 个情感分析模型,用 Python 的 transformers pipeline 只需 5 行代码即可调用,默认模型对 "I love you" 和 "I hate you" 的预测置信度分别为 0.9998 和 0.9991。
Hugging Face 博客介绍了利用 Wav2Vec2 的 CTC 架构特性,通过带 stride 的重叠分块推理,让 ASR 在任意长音频上也能保持高质量识别。只需在 pipeline 中设置 chunk_length_s 和 stride_length_s,即可避免直接处理长文件时的显存溢出,该技巧同样适用于 LM 增强的 Wav2Vec2 模型,并可用于实时推理。
Hugging Face 为 huggingface_hub 库新增 ModelSearchArguments、DatasetSearchArguments 和 ModelFilter 类,让用户无需离开 Jupyter 或 Python 环境即可按任务、数据集、框架等条件搜索 Hub 上的模型和数据集。
Hugging Face 宣布将 PyTorch 深度强化学习库 Stable-Baselines3 集成到 Hugging Face Hub,用户可通过 pip install huggingface_sb3 上传和加载已保存的模型。
Hugging Face 公布 Infinity 在第三代 Intel Xeon 可扩展处理器(Ice Lake)上的端到端推理基准:为 DistilBERT 序列分类任务优化的容器相比同平台原生 Transformers 延迟与吞吐最高提升 800%,相比上一代 Cascade Lake 实例提升 34%。
🤗 Transformers 现已集成 Kensho Technologies 的 pyctcdecode 库,可将 n-gram 语言模型与微调后的 Wav2Vec2 检查点结合用于音频解码。
Hugging Face 发布教程,介绍如何用 Amazon SageMaker 和 Hugging Face Inference Toolkit 部署 GPT-J 6B 做实时推理,可在 NVIDIA T4 等常规 GPU 实例(约 500 美元/月)上运行。
Hugging Face 的 AutoNLP 与 Explosion 的标注工具 Prodigy 可组合成主动学习流水线:先用 Prodigy 对 BBC News 数据集做 NER 标注,约 20 条样本后即用 AutoNLP 训练模型。AutoNLP 支持二分类、多分类、token 分类、问答、摘要等任务,价格低至每模型 $10,本次多分类实验最佳模型准确率达 98.67%。
Hugging Face 收购机器学习初创公司 Gradio,Gradio 创始人以当事方身份宣布了这一消息。Gradio 于 2019 年由斯坦福博士生 Abubakar Abid 与室友 Ali Abdalla、Ali Abid、Dawood Khan 发布首版,从计算机视觉扩展到文本、语音和视频,至今已有超过 30 万个 demo 用它构建。
推荐理由:Gradio 创始人以当事方身份讲述被 Hugging Face 收购的经过,并回顾了这款开源库从 2019 年起步到 30 万 demo 的历程。
Hugging Face 宣布在 Transformers 库中加入 Perceiver IO,这是首个基于 Transformer、可处理文本、图像、音频、视频、点云等多种模态及其组合的神经网络。
推荐理由:Hugging Face 把 Perceiver IO 接入 Transformers,读者可了解这套统一处理文本、图像、音频、视频的架构如何落地调用。
Hugging Face 发布教程,介绍如何从零训练 GPT-2 大模型 CodeParrot,用于自动补全 Python 代码。
Hugging Face 发布 Accelerate 库,原文正文抓取失败,仅标题可用。