UCLA 发布 ConTextual:多模态模型在富文本场景中的图文联合推理评测基准
UCLA 研究者推出 ConTextual,一个面向 LMM 的上下文敏感富文本视觉推理数据集,含 506 条指令,覆盖时间阅读、购物、导航、信息图等 8 类真实场景,并同步上线排行榜。
UCLA 研究者推出 ConTextual,一个面向 LMM 的上下文敏感富文本视觉推理数据集,含 506 条指令,覆盖时间阅读、购物、导航、信息图等 8 类真实场景,并同步上线排行榜。
Argilla 与 Hugging Face 推出 Data is Better Together 实验,几天内吸引 350 名社区贡献者完成超 11,000 条 prompt 评分,并发布含 10,000 条 prompt 用户评分的 10k_prompts_ranked 数据集。
BigCode 发布新一代透明训练的开放代码大模型 StarCoder2,包含 3B、7B、15B 三个尺寸,分别由 ServiceNow、Hugging Face 和 NVIDIA 训练。
推荐理由:BigCode 公开了 StarCoder2 三个尺寸的模型、训练数据与训练代码,读者可据此了解开源代码模型的数据规模与开放程度。
OpenAI 探索在视频数据上大规模训练生成模型,将文本条件扩散模型联合训练于不同时长、分辨率和宽高比的视频与图像,并采用在视频和图像潜码时空 patch 上运行的 Transformer 架构。其最大模型 Sora 能生成一分钟高保真视频,结果提示扩展视频生成模型是构建通用物理世界模拟器的一条可行路径。
推荐理由:OpenAI 公开了视频生成模型的训练思路,读者可了解扩散模型与 Transformer 如何被用于构建物理世界模拟器。
OpenAI 推出数据合作伙伴计划,与各方合作创建用于 AI 训练的开源和私有数据集。
Mistral AI 发布首个 7B 参数模型 Mistral 7B,称其在所有标准英文与代码基准上超过当时所有 13B 参数以下的开源模型,并以 Apache 2.0 许可发布,可无限制使用。
推荐理由:Mistral AI 首次公开其开源路线与 Mistral 7B 的基准表现,可了解开放权重模型当时的性能位置。
OpenAI 与 Scale 达成合作,企业客户可借助 Scale 的 AI 专业能力微调 OpenAI 最先进的模型。
OpenAI 宣布开发者现在可以自带数据对 GPT-3.5 Turbo 进行微调,以适配自己的使用场景,同时更新了 API。
推荐理由:OpenAI 开放 GPT-3.5 Turbo 微调,开发者可用自有数据定制模型,值得关注其对应用落地方式的影响。
Viable 借助 GPT-4 以革命性规模分析定性数据,并实现前所未有的准确度。
OpenAI 使用 GPT-4 自动为大型语言模型中的神经元行为撰写解释,并对这些解释进行评分。团队公开了覆盖 GPT-2 每个神经元的解释与评分数据集,并说明这些解释并不完美。
ChatGPT 用户现在可以关闭聊天记录,从而自行选择哪些对话可以被用于训练 OpenAI 的模型。
推荐理由:ChatGPT 新增关闭聊天记录开关,用户可自行决定哪些对话被用于模型训练。
Hugging Face 博客介绍如何在 24GB 消费级 GPU 上通过 RLHF 微调 20B 大语言模型。
Hugging Face 发布用 Diffusers 的 Dreambooth 脚本微调 Stable Diffusion 的实验总结,指出 Dreambooth 容易过拟合,需要在训练步数和学习率之间找平衡,建议先用低学习率再逐步增加步数。
推荐理由:Hugging Face 基于多组对照实验给出 Dreambooth 微调 Stable Diffusion 的学习率、步数与先验保留建议,可直接迁移到自己的训练配置。
Hugging Face 推出 MTEB(Massive Text Embedding Benchmark),一个覆盖 8 类任务、56 个数据集、最多 112 种语言的文本嵌入模型评测基准,排行榜已汇总超 2000 条结果。用户可通过 `pip install mteb` 对任意嵌入模型进行评测,并将结果提交至公开排行榜。
Hugging Face 宣布用户可直接在 Hub 上为模型或数据集生成 DOI,该功能已与 DataCite 合作实现。注册用户填写必要元数据后即可获得 DOI,他人可通过模型或数据集页面上的“Cite this model/dataset”按钮引用其工作。带 DOI 的数据集和模型将被永久保留,仅可在向官方支持提交请求后删除。
Hugging Face 在 Evaluation on the Hub 上线零样本分类评测,由 AutoTrain 驱动,无需写代码即可评测 Hub 上的任意因果语言模型,目前支持最大 66B 参数模型。
Hugging Face 与 Intel Labs、UKP Lab 合作推出 SetFit,一个面向 Sentence Transformers 的高效少样本微调框架,无需提示词或 verbaliser。
推荐理由:原文给出 SetFit 的两阶段训练流程与 RAFT 基准对比,读者可了解无提示词少样本分类的实现方式与成本。
Hugging Face 发布教程,讲解如何在 NVIDIA GPU 上用 Megatron-LM 训练 GPT2 语言模型并接入 Transformers。Megatron-LM 通过高效 DataLoader、Fused CUDA Kernels 和 Apex 的 Fused AdamW 实现加速,但使用门槛高于 Accelerate 和 Trainer。
Hugging Face 发布教程,介绍如何用 3Dmol.js 和 Gradio 的 HTML 组件在 Hugging Face Spaces 中可视化蛋白质结构。用户可输入 4 位 PDB 代码或上传 PDB 文件,应用会从 RCSB Protein Databank 获取结构并渲染。文章还提到可用 Molecule3D Gradio 自定义组件简化这一流程。
Hugging Face 发布教程,演示如何在 AWS DL1 实例上借助 Habana Gaudi 从零预训练 BERT-base,使用 Transformers、Optimum Habana 和 Datasets 库完成掩码语言建模任务。
Hugging Face 将 LLM.int8() 集成进 transformers 和 accelerate,用 8-bit 矩阵乘法把大模型显存占用降到约四分之一且不损失推理性能。
推荐理由:文章把 8-bit 量化原理、LLM.int8() 的离群值分解和 transformers 集成细节讲透,便于理解大模型显存占用来源。
Hugging Face 发布教程,讲解如何从零构建或微调 Sentence Transformers 模型。模型由预训练 Transformer(如 distilroberta-base)加池化层组成,可将变长文本映射为固定长度嵌入向量;相比直接用 BERT,语义搜索 1 万句的耗时从约 65 小时降至约 5 秒。教程还介绍了四种数据集格式与对应损失函数的选择。
Hugging Face 为 🤗 Datasets 补充了音频和图像数据集的文档,Quickstart 新增按模态选择数据集的端到端示例,并引入 to_tf_dataset 函数,可将数据集转换为 tf.data.Dataset 供 TensorFlow 或 Keras 训练。
Hugging Face 博客介绍动态对抗数据收集(DADC):让用户在与模型交互中构造能骗过模型的样本,再将这些对抗样本用于训练,多轮重复以提升鲁棒性。教程以 MNIST 手写数字识别为例,用 🤗 Spaces 搭建交互 demo,模型训练 20 个 epoch 后在测试集上达到 89% 准确率,并通过 flag 机制把对抗样本存入数据集再训练。
Hugging Face 披露了 176B 参数多语言模型 BLOOM 的训练技术细节,该模型基于 Megatron-DeepSpeed 的 3D 并行方案,在 384 张 80GB A100 GPU 上训练约 3.5 个月,消耗约 1M 计算时。训练数据为 59 种语言、350B token,模型词表规模 250,680,架构接近 GPT3 并加入若干改进。
Hugging Face 发布 BLOOM,一个 176B 参数的多语言大语言模型,可生成 46 种自然语言和 13 种编程语言的文本。该模型由 70 多个国家、250 多家机构的 1000 多名研究者协作完成,在法国 Jean Zay 超算上训练 117 天,并首次公开训练中间检查点和优化器状态。
推荐理由:BLOOM 以 176B 参数覆盖 46 种自然语言,并公开训练中间检查点,可据此了解开放大模型的训练与复现路径。
Hugging Face 发布入门指南,以 Sentence Transformers 为例讲解如何从零启动第一个 ML 项目。该库可将句子、段落和图像转为嵌入向量,并通过 util.cos_sim 计算余弦相似度,已在 GitHub 收获近 8,000 stars,超过 3,000 个项目依赖它。文中还给出选题方法:先梳理工具能力,再从 Hugging Face Hub 等渠道寻找数据。
Hugging Face 介绍如何通过 Accelerate 库调用 DeepSpeed 的 ZeRO 功能加速大模型训练,无需改动代码即可启用。
OpenAI 提出 Video PreTraining(VPT)方法,在大量无标注的人类玩 Minecraft 视频数据上训练神经网络,仅使用少量承包商标注数据。经微调后,模型能学会制作钻石工具,这一任务通常需要熟练人类花费 20 多分钟、约 24000 次操作。模型使用键盘按键和鼠标移动这类原生人类交互接口,通用性较强,是迈向通用计算机使用智能体的一步。
推荐理由:OpenAI 用少量标注数据加海量无标注视频训练出能玩 Minecraft 的模型,可了解视频预训练这条路径的早期做法。
OpenAI 训练了“批评写作”模型,用于描述摘要中的缺陷。人类评估者在看到模型给出的批评后,发现摘要缺陷的频率明显提高。研究还发现,更大的模型自我批评能力更强,规模对批评写作的提升大于对摘要写作的提升,这为用 AI 系统辅助人类监督 AI 系统提供了可能。
OpenAI 发文梳理训练大型神经网络的技术,指出这类模型是近期多项 AI 进展的核心,但训练本身是艰巨的工程与研究挑战,需要编排一整个 GPU 集群来完成单次同步计算。
Hugging Face 博客发布《The Annotated Diffusion Model》,基于 Ho 等人 2020 年的 DDPM 论文,用 PyTorch 逐步实现扩散模型。
推荐理由:以 PyTorch 逐步实现 DDPM,从数学推导到 U-Net 代码,适合想动手复现扩散模型的读者。
Hugging Face 深度强化学习课程第三单元讲解 Deep Q-Learning,用神经网络替代 Q-table 来近似每个动作的 Q 值,并训练智能体玩 Space Invaders 等 Atari 环境。
微软提出 TAPEX,通过让 BART 学习执行合成 SQL 查询来实现表格预训练,无需真实标注数据。该方法在 WikiSQL、TabFact、SQA 和 WikiTableQuestions 四个基准上均取得 SOTA,其中 WikiSQL 准确率达 89.6%,WikiTableQuestions 达 57.5%。
Hugging Face 研究科学家 Sasha Luccioni 在访谈中介绍了她在 Big Science 项目中主持碳足迹工作组的工作,研究范围不止于 CO2 排放,还包括制造成本,甚至测算一封邮件产生多少 CO2。
Hugging Face 推出免费深度强化学习课程,第一单元讲解深度强化学习基础,涵盖强化学习框架、马尔可夫性质、策略与价值方法等核心概念。课程使用 Stable Baselines3、RL Baselines3 Zoo 和 RLlib 等库,并让学员训练首个登月着陆器智能体并上传至 Hugging Face Hub。
Hugging Face 展示如何用 Accelerate 库无需改代码即可调用 PyTorch 的 FullyShardedDataParallel(FSDP)训练大模型。
HuggingFace AutoTrain 与数据标注平台 Kili 可组合成文本分类的主动学习流水线,实现数据清洗、模型选择和超参数优化的全自动。示例用 Google Play 上约 4 万条 Medium 用户评论,在 Kili 中按 Subscription、Content、Interface、User Experience 四类标注,再对分类结果做情感分析。
Hugging Face 与 Habana Labs 合作,展示如何在 AWS EC2 DL1 实例(搭载 8 颗 Habana Gaudi 处理器)上微调 BERT 模型。
Hugging Face 发布教育计划,目标到 2023 年底教会 500 万人机器学习。该计划面向所有人、初学者和教师三类人群,提供 NLP、深度强化学习、Gradio 演示构建等免费课程,以及翻译成 8 种语言的免费教学工具包,教师可在 Hub 上免费创建课堂。此前 2022 年 3 月的 ML demo.cratization 巡讲已为 16 个国家超 1000 名学生授课。