用 Python 入门情感分析:Hugging Face 预训练模型与微调指南
Hugging Face Hub 上已有超过 215 个情感分析模型,用 Python 的 transformers pipeline 只需 5 行代码即可调用,默认模型对 "I love you" 和 "I hate you" 的预测置信度分别为 0.9998 和 0.9991。
Hugging Face Hub 上已有超过 215 个情感分析模型,用 Python 的 transformers pipeline 只需 5 行代码即可调用,默认模型对 "I love you" 和 "I hate you" 的预测置信度分别为 0.9998 和 0.9991。
Hugging Face 博客介绍了利用 Wav2Vec2 的 CTC 架构特性,通过带 stride 的重叠分块推理,让 ASR 在任意长音频上也能保持高质量识别。只需在 pipeline 中设置 chunk_length_s 和 stride_length_s,即可避免直接处理长文件时的显存溢出,该技巧同样适用于 LM 增强的 Wav2Vec2 模型,并可用于实时推理。
OpenAI 训练出比 GPT-3 更能遵循用户意图的语言模型,同时更真实、毒性更低,所用技术来自其对齐研究。这些名为 InstructGPT 的模型采用人类参与训练的方式,现已作为 OpenAI API 的默认语言模型部署。
推荐理由:OpenAI 说明 InstructGPT 如何通过人类反馈训练,让模型更贴合用户意图并成为 API 默认模型。
OpenAI 在 API 中推出 embeddings 端点,用于自然语言和代码任务。该端点可支持语义搜索、聚类、主题建模和分类等场景。
推荐理由:OpenAI 在 API 中新增 embeddings 端点,读者可了解它面向语义搜索、聚类等任务的定位。
Hugging Face 为 huggingface_hub 库新增 ModelSearchArguments、DatasetSearchArguments 和 ModelFilter 类,让用户无需离开 Jupyter 或 Python 环境即可按任务、数据集、框架等条件搜索 Hub 上的模型和数据集。
Hugging Face 宣布将 PyTorch 深度强化学习库 Stable-Baselines3 集成到 Hugging Face Hub,用户可通过 pip install huggingface_sb3 上传和加载已保存的模型。
Hugging Face 公布 Infinity 在第三代 Intel Xeon 可扩展处理器(Ice Lake)上的端到端推理基准:为 DistilBERT 序列分类任务优化的容器相比同平台原生 Transformers 延迟与吞吐最高提升 800%,相比上一代 Cascade Lake 实例提升 34%。
🤗 Transformers 现已集成 Kensho Technologies 的 pyctcdecode 库,可将 n-gram 语言模型与微调后的 Wav2Vec2 检查点结合用于音频解码。
Hugging Face 发布教程,介绍如何用 Amazon SageMaker 和 Hugging Face Inference Toolkit 部署 GPT-J 6B 做实时推理,可在 NVIDIA T4 等常规 GPU 实例(约 500 美元/月)上运行。
Hugging Face 的 AutoNLP 与 Explosion 的标注工具 Prodigy 可组合成主动学习流水线:先用 Prodigy 对 BBC News 数据集做 NER 标注,约 20 条样本后即用 AutoNLP 训练模型。AutoNLP 支持二分类、多分类、token 分类、问答、摘要等任务,价格低至每模型 $10,本次多分类实验最佳模型准确率达 98.67%。
Hugging Face 收购机器学习初创公司 Gradio,Gradio 创始人以当事方身份宣布了这一消息。Gradio 于 2019 年由斯坦福博士生 Abubakar Abid 与室友 Ali Abdalla、Ali Abid、Dawood Khan 发布首版,从计算机视觉扩展到文本、语音和视频,至今已有超过 30 万个 demo 用它构建。
推荐理由:Gradio 创始人以当事方身份讲述被 Hugging Face 收购的经过,并回顾了这款开源库从 2019 年起步到 30 万 demo 的历程。
OpenAI 对 GPT-3 进行微调,使其借助基于文本的网页浏览器更准确地回答开放式问题,并将该工作命名为 WebGPT。
推荐理由:OpenAI 用文本浏览器微调 GPT-3 提升开放问答的事实准确率,可了解早期检索增强思路。
Hugging Face 宣布在 Transformers 库中加入 Perceiver IO,这是首个基于 Transformer、可处理文本、图像、音频、视频、点云等多种模态及其组合的神经网络。
推荐理由:Hugging Face 把 Perceiver IO 接入 Transformers,读者可了解这套统一处理文本、图像、音频、视频的架构如何落地调用。
OpenAI 发布文章介绍为应用定制 GPT-3 的方法,指出可通过单条命令完成微调。
Hugging Face 发布教程,介绍如何从零训练 GPT-2 大模型 CodeParrot,用于自动补全 Python 代码。
OpenAI 宣布推出 OpenAI Residency,作为其支持和培养 AI 人才努力的一部分。该项目面向 AI 人才发展,具体申请条件与时间安排未在公告中披露。
OpenAI 宣布其 API 不再需要等待名单,向更多开发者开放。官方表示,这一更广泛的可用性得益于安全方面的进展。
推荐理由:OpenAI 宣布 API 取消等待名单,读者可据此了解其开放节奏与安全进展的关系。
OpenAI 训练了一个求解小学阶段数学应用题的系统,准确率约为微调 GPT-3 模型的两倍。该系统能解出约 90% 的题目数量,与真实儿童相当:9-12 岁小样本在其数据集测试中得分 60%,系统在同一批题目上得分 55%。
推荐理由:OpenAI 用小学数学应用题对比微调 GPT-3 与儿童成绩,可了解当时模型解题能力的实际水平。
OpenAI 发布关于用人类反馈总结书籍的研究,聚焦如何对难以评估的任务扩大人类监督规模。
OpenAI 宣布任命 Helen Toner 加入其董事会。Toner 现任乔治城大学安全与新兴技术中心(CSET)战略主管。
OpenAI 推出改进版 Codex,这一将自然语言转换为代码的 AI 系统即日起通过 API 开放私测。
OpenAI 发布 Triton 1.0,这是一门类 Python 的开源编程语言,让没有 CUDA 经验的研究者也能编写高效的 GPU 代码,性能多数情况下可达到专家水平。
推荐理由:OpenAI 开源 Triton 1.0,让没有 CUDA 经验的研究者也能写出接近专家水平的 GPU 代码。
OpenAI 研究发现,用一个小规模精选数据集对语言模型进行微调,即可改善其在特定行为价值观方面的表现。
OpenAI 宣布 2021 届 OpenAI Scholars 已完成为期六个月的导师计划,并在 OpenAI 提供的津贴与支持下完成了开源研究项目。
OpenAI 宣布美国国会议员 Will Hurd 加入其董事会。OpenAI 表示,实现造福全人类的通用人工智能目标,既需要技术专长,也需要公共政策方面的经验。
Hugging Face 发布 Accelerate 库,原文正文抓取失败,仅标题可用。
OpenAI 表示,已有超过 300 款应用通过其 API 提供由 GPT-3 驱动的搜索、对话、文本补全等 AI 功能。
OpenAI 在 CLIP 中发现了一类多模态神经元,无论概念以字面、符号还是概念化形式呈现,这些神经元都会产生响应。OpenAI 表示,这或许能解释 CLIP 为何能准确分类出人意料的概念视觉呈现,也是理解 CLIP 及类似模型所学关联与偏置的重要一步。
推荐理由:OpenAI 公开了 CLIP 中多模态神经元的发现,为理解模型如何跨形式关联概念提供了线索。
OpenAI 把 Kubernetes 集群扩展到 7,500 节点,为 GPT-3、CLIP 和 DALL·E 等大模型提供可扩展基础设施,同时也支撑小规模快速迭代研究,例如 Scaling Laws for Neural Language Models。
OpenAI 发布名为 CLIP 的神经网络,通过自然语言监督高效学习视觉概念。CLIP 只需提供待识别视觉类别的名称,即可应用于任意视觉分类基准,类似 GPT-2 和 GPT-3 的零样本能力。
推荐理由:OpenAI 官方介绍 CLIP 如何用自然语言监督学习视觉概念,并说明其零样本迁移到任意分类基准的方式。
OpenAI 训练了一个名为 DALL·E 的神经网络,可根据自然语言文本描述生成图像,覆盖自然语言可表达的多种概念。
推荐理由:OpenAI 公开 DALL·E 这一从文本生成图像的神经网络,可了解文生图方向的早期形态。
OpenAI 发布组织架构更新,称过去一年公司经历了剧烈变化与增长。
OpenAI 已同意将 GPT-3 授权给 Microsoft,供其用于自家产品和服务。
推荐理由:OpenAI 将 GPT-3 授权给 Microsoft 用于自家产品,读者可借此了解早期大模型商业授权的合作方式。
OpenAI 将人类反馈强化学习(RLHF)应用于语言模型训练,使其在摘要任务上表现更好。
OpenAI Scholars 2020 届学员在线上 Demo Day 展示了他们过去五个月的研究成果,这是该项目的第三届学员。
OpenAI 与 AIcrowd、卡内基梅隆大学及 DeepMind 联合举办两场 NeurIPS 2020 竞赛,分别基于 Procgen Benchmark 和 MineRL。
OpenAI 发现,正如在语言上训练的大型 Transformer 模型能生成连贯文本,同一模型在像素序列上训练后也能生成连贯的图像补全与样本。通过建立样本质量与图像分类准确率之间的相关性,OpenAI 表明其最佳生成模型在无监督设置下所含特征可与顶级卷积网络竞争。
推荐理由:OpenAI 用同一 Transformer 架构处理像素序列,并给出生成质量与分类精度的关联证据。
OpenAI 发布了一个 API,用于访问 OpenAI 开发的新 AI 模型。
OpenAI 发布一项分析,指出自 2012 年以来,在 ImageNet 分类任务上训练神经网络达到同等性能所需的算力每 16 个月减少一半。与 2012 年相比,如今训练一个达到 AlexNet 水平的神经网络所需算力减少 44 倍,而同期摩尔定律带来的成本改善为 11 倍。分析认为,在近期投入较高的 AI 任务上,算法进步带来的收益超过传统硬件效率的提升。
推荐理由:OpenAI 用 ImageNet 训练算力数据量化算法进步,读者可据此理解算法效率与硬件效率的相对贡献。
OpenAI 推出 Jukebox,一个能生成音乐的神经网络,可输出多种流派和艺术家风格的原始音频,并包含初步的歌唱。OpenAI 同时发布了模型权重和代码,以及一个用于探索生成样本的工具。
推荐理由:OpenAI 公开 Jukebox 的模型权重与代码,读者可了解这套音乐生成神经网络的能力边界与开放程度。