用 transformers、accelerate 和 bitsandbytes 实现 8-bit 矩阵乘法入门
Hugging Face 将 LLM.int8() 集成进 transformers 和 accelerate,用 8-bit 矩阵乘法把大模型显存占用降到约四分之一且不损失推理性能。
推荐理由:文章把 8-bit 量化原理、LLM.int8() 的离群值分解和 transformers 集成细节讲透,便于理解大模型显存占用来源。
Hugging Face 将 LLM.int8() 集成进 transformers 和 accelerate,用 8-bit 矩阵乘法把大模型显存占用降到约四分之一且不损失推理性能。
推荐理由:文章把 8-bit 量化原理、LLM.int8() 的离群值分解和 transformers 集成细节讲透,便于理解大模型显存占用来源。
Hugging Face 阐述了其 transformers 库在 TensorFlow 上的设计哲学:所有 TensorFlow 模型都是 Keras Model 对象,所有层都是 Keras Layer 对象,因此可直接调用 fit()、compile() 和 predict()。
Hugging Face 发布新库 Skops,可将 scikit-learn 模型托管到 Hugging Face Hub,并生成模型卡进行文档记录与协作。Skops 通过 hub_utils.init 生成含模型文件与环境配置的本地仓库,后端使用 joblib 加载模型,支持 pickle 等序列化方式。
Hugging Face 发布教程,讲解如何用 Docker 和 Kubernetes 将本地部署的 Vision Transformer(ViT)模型扩展为可服务多用户的线上服务。流程包括用 TensorFlow Serving 基础镜像容器化 SavedModel,再部署到 Google Kubernetes Engine(GKE)集群,Minikube 同样适用。
OpenAI 发布新版内容审核工具 Moderation endpoint,改进此前的内容过滤器,即日起向 OpenAI API 开发者免费开放。
Hugging Face 发布教程,讲解如何从零构建或微调 Sentence Transformers 模型。模型由预训练 Transformer(如 distilroberta-base)加池化层组成,可将变长文本映射为固定长度嵌入向量;相比直接用 BERT,语义搜索 1 万句的耗时从约 65 小时降至约 5 秒。教程还介绍了四种数据集格式与对应损失函数的选择。
Hugging Face 深度强化学习课程第 8 单元讲解 Proximal Policy Optimization(PPO),通过计算新旧策略的概率比并将其裁剪在 [1−ϵ,1+ϵ] 区间内,避免策略更新过大、提升训练稳定性。
Hugging Face 发布 Private Hub(PH),将模型、数据集、Spaces 等 ML 工具整合到统一平台,支持企业在安全合规环境下协作开发。Hugging Face Hub 现有超 60K 模型、6K 数据集和 6K 演示应用,模型覆盖 180 种语言、支持最多 25 个 ML 库。约 90% 的机器学习模型从未进入生产环境,PH 旨在加速从研究到生产的全流程。
Nyströmformer 通过 Nyström 方法近似标准自注意力,将时间和内存复杂度从 O(n²) 降至 O(n)。它不直接对 softmax 矩阵采样,而是从 query 和 key 中用分段均值构造 landmark,仅需 32 或 64 个 landmark 即可在 n=4096 或 8192 的长序列上取得与标准自注意力及其他高效注意力机制相当的性能。
Hugging Face 于 2022 年 6 月就美国国家 AI 研究资源(NAIRR)中期报告提交反馈,建议任命技术与伦理专家担任顾问、制定模型与数据文档标准、为非技术专家提供低代码或无代码工具,并推动开源与开放科学的高风险滥用监测。其回应还建议投入法律专业能力制定负责任 AI 许可证,并以多语言资源支持多元研究者视角,BigScience 研究工坊被列为范例。
Hugging Face 为 🤗 Datasets 补充了音频和图像数据集的文档,Quickstart 新增按模态选择数据集的端到端示例,并引入 to_tf_dataset 函数,可将数据集转换为 tf.data.Dataset 供 TensorFlow 或 Keras 训练。
Hugging Face 的 transformers 库在 TensorFlow 下现可通过 XLA 编译文本生成,速度最高提升 100 倍,甚至快于 PyTorch。该功能需 transformers >= 4.21.0,支持采样、贪心解码、Beam Search 及 temperature、max_new_tokens 等参数控制。
Hugging Face 与外部贡献者已在 Transformers 中加入 Vision Transformer、Masked Autoencoders、RegNet。
Hugging Face 深度强化学习课程 Unit 7 讲解 Advantage Actor Critic(A2C),一种结合基于策略与基于价值方法的混合架构,通过 Actor 控制智能体行为、Critic 评估动作好坏来降低 Reinforce 中蒙特卡洛采样带来的高方差。课程使用 Stable-Baselines3 在 PyBullet 机器人环境中训练双足步行者和蜘蛛两个智能体行走。
OpenAI 宣布 DALL·E 进入测试版,将在未来几周从候补名单中邀请 100 万人使用。用户可用每月重置的免费额度生成图像,也可按 115 次生成一档、15 美元的价格购买额外额度。
推荐理由:原文给出 DALL·E 测试版开放规模与免费额度、付费增量价格,便于读者了解早期图像生成产品的开放方式。
OpenAI 为 DALL·E 2 引入一项新技术,使其生成的人物图像更准确地反映世界人口的多样性,以减少偏见并提升安全性。
Hugging Face 博客介绍动态对抗数据收集(DADC):让用户在与模型交互中构造能骗过模型的样本,再将这些对抗样本用于训练,多轮重复以提升鲁棒性。教程以 MNIST 手写数字识别为例,用 🤗 Spaces 搭建交互 demo,模型训练 20 个 epoch 后在测试集上达到 89% 准确率,并通过 flag 机制把对抗样本存入数据集再训练。
OpenAI 在 DALL·E 2 研究预览中,已有来自 118 个以上国家的 3000 多名艺术家将 DALL·E 融入创作流程。早期访问组的艺术家帮助发现了 DALL·E 的新用途,并在 DALL·E 功能决策中提供了关键意见。
Hugging Face 披露了 176B 参数多语言模型 BLOOM 的训练技术细节,该模型基于 Megatron-DeepSpeed 的 3D 并行方案,在 384 张 80GB A100 GPU 上训练约 3.5 个月,消耗约 1M 计算时。训练数据为 59 种语言、350B token,模型词表规模 250,680,架构接近 GPT3 并加入若干改进。
用 Sentence Transformers 的语义搜索搭建歌单生成器:将歌词按段落切块并嵌入,以 msmarco-MiniLM-L-6-v3 生成提示词嵌入,检索最相近的段落,top_k=20 时通常能得到至少 9 首不同歌曲。整个多步 Gradio 应用基于 Blocks API 构建并托管在 Hugging Face Spaces,歌词嵌入已发布在 Hugging Face Hub 上。
Hugging Face 发布 BLOOM,一个 176B 参数的多语言大语言模型,可生成 46 种自然语言和 13 种编程语言的文本。该模型由 70 多个国家、250 多家机构的 1000 多名研究者协作完成,在法国 Jean Zay 超算上训练 117 天,并首次公开训练中间检查点和优化器状态。
推荐理由:BLOOM 以 176B 参数覆盖 46 种自然语言,并公开训练中间检查点,可据此了解开放大模型的训练与复现路径。
Hugging Face 发布 Twitter 情感分析入门指南,介绍用 Inference API 几行代码即可批量分析推文情感,并给出无代码方案 Zapier 采集推文、调用 Inference API 分析后写入 Google Sheets。
Hugging Face 深度强化学习课程第 5 单元讲解策略梯度方法,并用 PyTorch 从零实现首个基于策略的算法 Reinforce,随后在 CartPole-v1、PixelCopter 和 Pong 上测试其鲁棒性。
Hugging Face 发布入门指南,以 Sentence Transformers 为例讲解如何从零启动第一个 ML 项目。该库可将句子、段落和图像转为嵌入向量,并通过 util.cos_sim 计算余弦相似度,已在 GitHub 收获近 8,000 stars,超过 3,000 个项目依赖它。文中还给出选题方法:先梳理工具能力,再从 Hugging Face Hub 等渠道寻找数据。
OpenAI 为向广泛受众开放 DALL·E 2,在预训练阶段采取缓解措施以降低强大图像生成模型带来的风险。为此,OpenAI 设置了多种防护栏,防止生成的图像违反其内容政策。
Hugging Face 推出 Evaluation on the Hub,由 AutoTrain 驱动,用户无需写一行代码即可在 Hub 上用任意数据集和指标评测任意模型。评测结果会以 Pull Request 形式写入模型卡元数据,并可在数据集页面的榜单中对比不同模型表现。官方已用该工具评测了数百个模型,并给出文本分类、命名实体识别和文本摘要等可直接试用的数据集。
推荐理由:原文说明了无需写代码即可在 Hub 上评测任意模型与数据集,并给出配置流程和榜单入口。
Hugging Face 介绍如何通过 Accelerate 库调用 DeepSpeed 的 ZeRO 功能加速大模型训练,无需改动代码即可启用。
OpenAI 提出 Video PreTraining(VPT)方法,在大量无标注的人类玩 Minecraft 视频数据上训练神经网络,仅使用少量承包商标注数据。经微调后,模型能学会制作钻石工具,这一任务通常需要熟练人类花费 20 多分钟、约 24000 次操作。模型使用键盘按键和鼠标移动这类原生人类交互接口,通用性较强,是迈向通用计算机使用智能体的一步。
推荐理由:OpenAI 用少量标注数据加海量无标注视频训练出能玩 Minecraft 的模型,可了解视频预训练这条路径的早期做法。
Hugging Face 发布入门教程,演示如何用 Sentence Transformers 的 all-MiniLM-L6-v2 模型和 Inference API 为美国 Medicare FAQ 数据集生成嵌入向量,并上传至 Hub 免费托管。用户查询经嵌入后与数据集比对,即可找出语义最相似的 FAQ 条目。首次调用 API 约需 20 秒下载模型,后续请求会明显加快。
Hugging Face 介绍了三种将 Transformers 模型转为 ONNX 的方法:底层 torch.onnx、中层 transformers.onnx 和 Optimum 高层 API。
Intel 正式加入 Hugging Face 硬件合作伙伴计划,双方将基于开源库 Optimum 共同构建面向 Transformer 训练、微调与推理的硬件加速方案。Optimum Intel 构建在 Intel Neural Compressor 之上,支持量化、剪枝与知识蒸馏,并已实现对 Habana Gaudi 加速器的支持,其性价比比 GPU 高出最多 40%。
Hugging Face 发布“机器学习负责人洞察”系列金融版,邀请来自 U.S. Bank、Royal Bank of Canada、Moody's Analytics 及前 Bloomberg AI 研究科学家的金融 ML 专家分享经验。
OpenAI 训练了“批评写作”模型,用于描述摘要中的缺陷。人类评估者在看到模型给出的批评后,发现摘要缺陷的频率明显提高。研究还发现,更大的模型自我批评能力更强,规模对批评写作的提升大于对摘要写作的提升,这为用 AI 系统辅助人类监督 AI 系统提供了可能。
OpenAI 发文梳理训练大型神经网络的技术,指出这类模型是近期多项 AI 进展的核心,但训练本身是艰巨的工程与研究挑战,需要编排一整个 GPU 集群来完成单次同步计算。
Hugging Face 博客发布《The Annotated Diffusion Model》,基于 Ho 等人 2020 年的 DDPM 论文,用 PyTorch 逐步实现扩散模型。
推荐理由:以 PyTorch 逐步实现 DDPM,从数学推导到 U-Net 代码,适合想动手复现扩散模型的读者。
Hugging Face 深度强化学习课程第三单元讲解 Deep Q-Learning,用神经网络替代 Q-table 来近似每个动作的 Q 值,并训练智能体玩 Space Invaders 等 Atari 环境。
Cohere、OpenAI 和 AI21 Labs 联合制定了一套初步的大语言模型最佳实践,适用于任何开发或部署大语言模型的组织。
Graphcore 与 Hugging Face 在开源库 Optimum 中新增一批适配 IPU 的 Transformer 模型,可访问模型总数达 10 个,覆盖 NLP、语音和计算机视觉,均附带 IPU 配置文件和预训练、微调权重。
Hugging Face 在 Hub 上线 pull requests 和 discussions,模型、数据集和 Spaces 三类仓库均可在 Community 标签页使用,任何社区成员都能创建和参与。
OpenAI Codex 现已通过 OpenAI API 为 70 款不同应用提供支持,覆盖多种使用场景。