用 Hugging Face Transformers 和 Habana Gaudi 预训练 BERT
Hugging Face 发布教程,演示如何在 AWS DL1 实例上借助 Habana Gaudi 从零预训练 BERT-base,使用 Transformers、Optimum Habana 和 Datasets 库完成掩码语言建模任务。
Hugging Face 发布教程,演示如何在 AWS DL1 实例上借助 Habana Gaudi 从零预训练 BERT-base,使用 Transformers、Optimum Habana 和 Datasets 库完成掩码语言建模任务。
Hugging Face 将 LLM.int8() 集成进 transformers 和 accelerate,用 8-bit 矩阵乘法把大模型显存占用降到约四分之一且不损失推理性能。
推荐理由:文章把 8-bit 量化原理、LLM.int8() 的离群值分解和 transformers 集成细节讲透,便于理解大模型显存占用来源。
Hugging Face 发布教程,讲解如何从零构建或微调 Sentence Transformers 模型。模型由预训练 Transformer(如 distilroberta-base)加池化层组成,可将变长文本映射为固定长度嵌入向量;相比直接用 BERT,语义搜索 1 万句的耗时从约 65 小时降至约 5 秒。教程还介绍了四种数据集格式与对应损失函数的选择。
Hugging Face 为 🤗 Datasets 补充了音频和图像数据集的文档,Quickstart 新增按模态选择数据集的端到端示例,并引入 to_tf_dataset 函数,可将数据集转换为 tf.data.Dataset 供 TensorFlow 或 Keras 训练。
Hugging Face 博客介绍动态对抗数据收集(DADC):让用户在与模型交互中构造能骗过模型的样本,再将这些对抗样本用于训练,多轮重复以提升鲁棒性。教程以 MNIST 手写数字识别为例,用 🤗 Spaces 搭建交互 demo,模型训练 20 个 epoch 后在测试集上达到 89% 准确率,并通过 flag 机制把对抗样本存入数据集再训练。
Hugging Face 披露了 176B 参数多语言模型 BLOOM 的训练技术细节,该模型基于 Megatron-DeepSpeed 的 3D 并行方案,在 384 张 80GB A100 GPU 上训练约 3.5 个月,消耗约 1M 计算时。训练数据为 59 种语言、350B token,模型词表规模 250,680,架构接近 GPT3 并加入若干改进。
Hugging Face 发布 BLOOM,一个 176B 参数的多语言大语言模型,可生成 46 种自然语言和 13 种编程语言的文本。该模型由 70 多个国家、250 多家机构的 1000 多名研究者协作完成,在法国 Jean Zay 超算上训练 117 天,并首次公开训练中间检查点和优化器状态。
推荐理由:BLOOM 以 176B 参数覆盖 46 种自然语言,并公开训练中间检查点,可据此了解开放大模型的训练与复现路径。
Hugging Face 发布入门指南,以 Sentence Transformers 为例讲解如何从零启动第一个 ML 项目。该库可将句子、段落和图像转为嵌入向量,并通过 util.cos_sim 计算余弦相似度,已在 GitHub 收获近 8,000 stars,超过 3,000 个项目依赖它。文中还给出选题方法:先梳理工具能力,再从 Hugging Face Hub 等渠道寻找数据。
Hugging Face 介绍如何通过 Accelerate 库调用 DeepSpeed 的 ZeRO 功能加速大模型训练,无需改动代码即可启用。
OpenAI 提出 Video PreTraining(VPT)方法,在大量无标注的人类玩 Minecraft 视频数据上训练神经网络,仅使用少量承包商标注数据。经微调后,模型能学会制作钻石工具,这一任务通常需要熟练人类花费 20 多分钟、约 24000 次操作。模型使用键盘按键和鼠标移动这类原生人类交互接口,通用性较强,是迈向通用计算机使用智能体的一步。
推荐理由:OpenAI 用少量标注数据加海量无标注视频训练出能玩 Minecraft 的模型,可了解视频预训练这条路径的早期做法。
OpenAI 训练了“批评写作”模型,用于描述摘要中的缺陷。人类评估者在看到模型给出的批评后,发现摘要缺陷的频率明显提高。研究还发现,更大的模型自我批评能力更强,规模对批评写作的提升大于对摘要写作的提升,这为用 AI 系统辅助人类监督 AI 系统提供了可能。
OpenAI 发文梳理训练大型神经网络的技术,指出这类模型是近期多项 AI 进展的核心,但训练本身是艰巨的工程与研究挑战,需要编排一整个 GPU 集群来完成单次同步计算。
Hugging Face 博客发布《The Annotated Diffusion Model》,基于 Ho 等人 2020 年的 DDPM 论文,用 PyTorch 逐步实现扩散模型。
推荐理由:以 PyTorch 逐步实现 DDPM,从数学推导到 U-Net 代码,适合想动手复现扩散模型的读者。
Hugging Face 深度强化学习课程第三单元讲解 Deep Q-Learning,用神经网络替代 Q-table 来近似每个动作的 Q 值,并训练智能体玩 Space Invaders 等 Atari 环境。
微软提出 TAPEX,通过让 BART 学习执行合成 SQL 查询来实现表格预训练,无需真实标注数据。该方法在 WikiSQL、TabFact、SQA 和 WikiTableQuestions 四个基准上均取得 SOTA,其中 WikiSQL 准确率达 89.6%,WikiTableQuestions 达 57.5%。
Hugging Face 研究科学家 Sasha Luccioni 在访谈中介绍了她在 Big Science 项目中主持碳足迹工作组的工作,研究范围不止于 CO2 排放,还包括制造成本,甚至测算一封邮件产生多少 CO2。
Hugging Face 推出免费深度强化学习课程,第一单元讲解深度强化学习基础,涵盖强化学习框架、马尔可夫性质、策略与价值方法等核心概念。课程使用 Stable Baselines3、RL Baselines3 Zoo 和 RLlib 等库,并让学员训练首个登月着陆器智能体并上传至 Hugging Face Hub。
Hugging Face 展示如何用 Accelerate 库无需改代码即可调用 PyTorch 的 FullyShardedDataParallel(FSDP)训练大模型。
HuggingFace AutoTrain 与数据标注平台 Kili 可组合成文本分类的主动学习流水线,实现数据清洗、模型选择和超参数优化的全自动。示例用 Google Play 上约 4 万条 Medium 用户评论,在 Kili 中按 Subscription、Content、Interface、User Experience 四类标注,再对分类结果做情感分析。
Hugging Face 与 Habana Labs 合作,展示如何在 AWS EC2 DL1 实例(搭载 8 颗 Habana Gaudi 处理器)上微调 BERT 模型。
Hugging Face 发布教育计划,目标到 2023 年底教会 500 万人机器学习。该计划面向所有人、初学者和教师三类人群,提供 NLP、深度强化学习、Gradio 演示构建等免费课程,以及翻译成 8 种语言的免费教学工具包,教师可在 Hub 上免费创建课堂。此前 2022 年 3 月的 ML demo.cratization 巡讲已为 16 个国家超 1000 名学生授课。
Hugging Face 发布博客,演示如何用其生态工具处理客户服务场景:将筛选最不满客户消息建模为文本分类任务,分为 very unsatisfied 到 very satisfied 五类。
Hugging Face 为 huggingface_hub 库新增 emissions_threshold 参数,可按训练碳排放量筛选 Hub 上的模型,例如筛选出 191 个排放不超过 100 克的模型。transformers 则通过集成 codecarbon,在 Trainer 训练时自动记录碳排放并生成 emissions.csv,方便开发者将数据填入模型卡。
Habana Labs 与 Hugging Face 宣布合作,将 Habana 的 SynapseAI 软件套件与 Hugging Face Optimum 开源库集成,开发者只需几行代码即可在 Habana 处理器上加速 Transformer 训练。
Hugging Face 将离线强化学习方法 Decision Transformer 集成进 transformers 库和 Hugging Face Hub,并发布 9 个 Gym 环境连续控制任务的预训练 checkpoint,覆盖 Hopper、Walker2D 和 Halfcheetah,Atari 环境 checkpoint 即将推出。
OpenAI 发起意向征集,邀请研究者申请参与大语言模型经济影响的研究。该征集面向有意研究 LLM 经济影响的各方,具体参与方式与研究方向未在公告中详述。
Hugging Face 发布教程,演示如何用 🤗 datasets 加载 beans 图像分类数据集,并借助 🤗 transformers 微调预训练的 google/vit-base-patch16-224-in21k 模型。
Hugging Face 宣布将 PyTorch 深度强化学习库 Stable-Baselines3 集成到 Hugging Face Hub,用户可通过 pip install huggingface_sb3 上传和加载已保存的模型。
Hugging Face 的 AutoNLP 与 Explosion 的标注工具 Prodigy 可组合成主动学习流水线:先用 Prodigy 对 BBC News 数据集做 NER 标注,约 20 条样本后即用 AutoNLP 训练模型。AutoNLP 支持二分类、多分类、token 分类、问答、摘要等任务,价格低至每模型 $10,本次多分类实验最佳模型准确率达 98.67%。
Hugging Face 发布教程,介绍如何从零训练 GPT-2 大模型 CodeParrot,用于自动补全 Python 代码。
OpenAI 宣布推出 OpenAI Residency,作为其支持和培养 AI 人才努力的一部分。该项目面向 AI 人才发展,具体申请条件与时间安排未在公告中披露。
OpenAI 训练了一个求解小学阶段数学应用题的系统,准确率约为微调 GPT-3 模型的两倍。该系统能解出约 90% 的题目数量,与真实儿童相当:9-12 岁小样本在其数据集测试中得分 60%,系统在同一批题目上得分 55%。
推荐理由:OpenAI 用小学数学应用题对比微调 GPT-3 与儿童成绩,可了解当时模型解题能力的实际水平。
OpenAI 发布关于用人类反馈总结书籍的研究,聚焦如何对难以评估的任务扩大人类监督规模。
OpenAI 研究发现,用一个小规模精选数据集对语言模型进行微调,即可改善其在特定行为价值观方面的表现。
OpenAI 宣布 2021 届 OpenAI Scholars 已完成为期六个月的导师计划,并在 OpenAI 提供的津贴与支持下完成了开源研究项目。
OpenAI 将人类反馈强化学习(RLHF)应用于语言模型训练,使其在摘要任务上表现更好。
OpenAI 发现,正如在语言上训练的大型 Transformer 模型能生成连贯文本,同一模型在像素序列上训练后也能生成连贯的图像补全与样本。通过建立样本质量与图像分类准确率之间的相关性,OpenAI 表明其最佳生成模型在无监督设置下所含特征可与顶级卷积网络竞争。
推荐理由:OpenAI 用同一 Transformer 架构处理像素序列,并给出生成质量与分类精度的关联证据。
OpenAI 发布一项分析,指出自 2012 年以来,在 ImageNet 分类任务上训练神经网络达到同等性能所需的算力每 16 个月减少一半。与 2012 年相比,如今训练一个达到 AlexNet 水平的神经网络所需算力减少 44 倍,而同期摩尔定律带来的成本改善为 11 倍。分析认为,在近期投入较高的 AI 任务上,算法进步带来的收益超过传统硬件效率的提升。
推荐理由:OpenAI 用 ImageNet 训练算力数据量化算法进步,读者可据此理解算法效率与硬件效率的相对贡献。
OpenAI 发现双重下降现象同样出现在 CNN、ResNet 和 Transformer 中:随着模型规模、数据量或训练时间增加,性能先提升、再变差、然后再次提升。这一效应通常可通过精细的正则化加以规避,但研究者尚不完全理解其成因,认为值得进一步研究。
OpenAI 发布 Procgen Benchmark,包含 16 个易于使用的程序化生成环境,用于直接衡量强化学习智能体学习可泛化技能的速度。