如何用 Megatron-LM 训练语言模型
Hugging Face 发布教程,讲解如何在 NVIDIA GPU 上用 Megatron-LM 训练 GPT2 语言模型并接入 Transformers。Megatron-LM 通过高效 DataLoader、Fused CUDA Kernels 和 Apex 的 Fused AdamW 实现加速,但使用门槛高于 Accelerate 和 Trainer。
Hugging Face 发布教程,讲解如何在 NVIDIA GPU 上用 Megatron-LM 训练 GPT2 语言模型并接入 Transformers。Megatron-LM 通过高效 DataLoader、Fused CUDA Kernels 和 Apex 的 Fused AdamW 实现加速,但使用门槛高于 Accelerate 和 Trainer。
Hugging Face 发布教程,介绍如何用 3Dmol.js 和 Gradio 的 HTML 组件在 Hugging Face Spaces 中可视化蛋白质结构。用户可输入 4 位 PDB 代码或上传 PDB 文件,应用会从 RCSB Protein Databank 获取结构并渲染。文章还提到可用 Molecule3D Gradio 自定义组件简化这一流程。
Hugging Face 展示了如何将 TensorFlow 版 ViT B/16 模型部署到 Google Cloud 的 Vertex AI 平台,用比 Kubernetes 更少的代码实现同等扩展性。
Hugging Face 发布教程,演示如何在 Graphcore IPU 上用 Optimum Graphcore 库微调预训练 ViT 模型,并以 ChestX-ray14 数据集训练胸部 X 光分类器为例提供完整 notebook。
Hugging Face 发布新库 Skops,可将 scikit-learn 模型托管到 Hugging Face Hub,并生成模型卡进行文档记录与协作。Skops 通过 hub_utils.init 生成含模型文件与环境配置的本地仓库,后端使用 joblib 加载模型,支持 pickle 等序列化方式。
Hugging Face 发布教程,讲解如何用 Docker 和 Kubernetes 将本地部署的 Vision Transformer(ViT)模型扩展为可服务多用户的线上服务。流程包括用 TensorFlow Serving 基础镜像容器化 SavedModel,再部署到 Google Kubernetes Engine(GKE)集群,Minikube 同样适用。
Hugging Face 发布 Private Hub(PH),将模型、数据集、Spaces 等 ML 工具整合到统一平台,支持企业在安全合规环境下协作开发。Hugging Face Hub 现有超 60K 模型、6K 数据集和 6K 演示应用,模型覆盖 180 种语言、支持最多 25 个 ML 库。约 90% 的机器学习模型从未进入生产环境,PH 旨在加速从研究到生产的全流程。
Hugging Face 的 transformers 库在 TensorFlow 下现可通过 XLA 编译文本生成,速度最高提升 100 倍,甚至快于 PyTorch。该功能需 transformers >= 4.21.0,支持采样、贪心解码、Beam Search 及 temperature、max_new_tokens 等参数控制。
Hugging Face 与外部贡献者已在 Transformers 中加入 Vision Transformer、Masked Autoencoders、RegNet。
Hugging Face 披露了 176B 参数多语言模型 BLOOM 的训练技术细节,该模型基于 Megatron-DeepSpeed 的 3D 并行方案,在 384 张 80GB A100 GPU 上训练约 3.5 个月,消耗约 1M 计算时。训练数据为 59 种语言、350B token,模型词表规模 250,680,架构接近 GPT3 并加入若干改进。
Hugging Face 介绍如何通过 Accelerate 库调用 DeepSpeed 的 ZeRO 功能加速大模型训练,无需改动代码即可启用。
Hugging Face 介绍了三种将 Transformers 模型转为 ONNX 的方法:底层 torch.onnx、中层 transformers.onnx 和 Optimum 高层 API。
Intel 正式加入 Hugging Face 硬件合作伙伴计划,双方将基于开源库 Optimum 共同构建面向 Transformer 训练、微调与推理的硬件加速方案。Optimum Intel 构建在 Intel Neural Compressor 之上,支持量化、剪枝与知识蒸馏,并已实现对 Habana Gaudi 加速器的支持,其性价比比 GPU 高出最多 40%。
Cohere、OpenAI 和 AI21 Labs 联合制定了一套初步的大语言模型最佳实践,适用于任何开发或部署大语言模型的组织。
Graphcore 与 Hugging Face 在开源库 Optimum 中新增一批适配 IPU 的 Transformer 模型,可访问模型总数达 10 个,覆盖 NLP、语音和计算机视觉,均附带 IPU 配置文件和预训练、微调权重。
Sempre Health 借助 Hugging Face 的 Expert Acceleration Program 搭建了自动分类并回复患者短信的 NLP 流水线,上线数周后近 20% 的入站消息由新系统自动处理。此前其基于规则的系统只能覆盖约 80% 的短信,Hugging Face 团队在标注质量、模型与方法选型上提供了指导,缩短了研发时间。
Hugging Face 在 Optimum 1.2 中加入推理与 Transformers pipelines 支持,首批接入 ONNX Runtime,用户可将 AutoModelForXxx 直接替换为对应的 ORTModelForXxx。
fastai 用户现在可以用一行 Python 将模型上传至 Hugging Face Hub,并通过 from_pretrained_fastai 直接加载他人模型。
Hugging Face 展示如何用 Accelerate 库无需改代码即可调用 PyTorch 的 FullyShardedDataParallel(FSDP)训练大模型。
Hugging Face 机器学习工程师 Lewis Tunstall 在访谈中介绍了与 Leandro von Werra 合著的《NLP with Transformers》,并讲述了自己从 2018 年使用 pytorch-pretrained-bert 到加入 Hugging Face 的经历。
Habana Labs 与 Hugging Face 宣布合作,将 Habana 的 SynapseAI 软件套件与 Hugging Face Optimum 开源库集成,开发者只需几行代码即可在 Habana 处理器上加速 Transformer 训练。
Hugging Face 发布端到端教程,演示如何用 Hugging Face Transformers、Amazon SageMaker 和 AWS Inferentia 加速 BERT 文本分类推理。
Hugging Face 公布 Infinity 在第三代 Intel Xeon 可扩展处理器(Ice Lake)上的端到端推理基准:为 DistilBERT 序列分类任务优化的容器相比同平台原生 Transformers 延迟与吞吐最高提升 800%,相比上一代 Cascade Lake 实例提升 34%。
Hugging Face 发布教程,介绍如何用 Amazon SageMaker 和 Hugging Face Inference Toolkit 部署 GPT-J 6B 做实时推理,可在 NVIDIA T4 等常规 GPU 实例(约 500 美元/月)上运行。
OpenAI 发布 Triton 1.0,这是一门类 Python 的开源编程语言,让没有 CUDA 经验的研究者也能编写高效的 GPU 代码,性能多数情况下可达到专家水平。
推荐理由:OpenAI 开源 Triton 1.0,让没有 CUDA 经验的研究者也能写出接近专家水平的 GPU 代码。
OpenAI 把 Kubernetes 集群扩展到 7,500 节点,为 GPT-3、CLIP 和 DALL·E 等大模型提供可扩展基础设施,同时也支撑小规模快速迭代研究,例如 Scaling Laws for Neural Language Models。
OpenAI 宣布将其深度学习框架标准化为 PyTorch。
OpenAI 发布针对块稀疏权重神经网络的高度优化 GPU 内核,按所选稀疏度可比 cuBLAS 或 cuSPARSE 快数个数量级。团队已用这些内核在文本情感分析和文本、图像生成建模上取得 SOTA 结果。
OpenAI 开源了一个基于 MuJoCo 引擎的高性能 Python 机器人仿真库,该库源自其过去一年的机器人研究。