Hugging Face TRL 推出 RLOO Trainer,把强化学习重新带回 RLHF
Hugging Face 在 TRL 中推出 RLOO(REINFORCE Leave One-Out)Trainer,作为 PPO 的在线 RLHF 替代方案。RLOO 只需加载策略、参考策略和奖励模型 3 份模型,比 PPO 少约 50-70% 显存,1B 模型上快 2 倍、6.9B 模型上快达 3 倍,响应胜率与 PPO 相当并持续优于 DPO 等离线方法。
Hugging Face 在 TRL 中推出 RLOO(REINFORCE Leave One-Out)Trainer,作为 PPO 的在线 RLHF 替代方案。RLOO 只需加载策略、参考策略和奖励模型 3 份模型,比 PPO 少约 50-70% 显存,1B 模型上快 2 倍、6.9B 模型上快达 3 倍,响应胜率与 PPO 相当并持续优于 DPO 等离线方法。
Mistral AI 在 la Plateforme 上线模型定制功能,提供三个入口:开源微调代码库 mistral-finetune、平台上的无服务器微调服务,以及面向特定客户的定制训练服务。
推荐理由:Mistral 同时给出开源微调代码库与托管微调服务,读者可据此比较自建与托管两条落地路径。
Mistral AI 于 6 月 5 日至 30 日举办线上微调黑客松,参赛项目必须使用其全新微调 API。前三名各获 2500 欧元 Mistral API 额度,入选者可申请 100 美元免费额度,需在 6 月 10 日前提交表单。评审按影响力、技术实现、创意和展示各占 25% 打分,团队最多 4 人。
Hugging Face 发布博客,介绍如何用 Python 库 Sentence Transformers 微调嵌入向量模型,以提升其在特定任务上的表现,也可用于从零训练新模型。
OpenAI 更新 ChatGPT 的数据分析功能,用户现在可以与表格和图表进行交互,并直接从 Google Drive 和 Microsoft OneDrive 添加文件。
OpenAI 与 Reddit 达成合作,将 Reddit 的独特内容带入 ChatGPT 及 OpenAI 旗下产品。
Hugging Face 发布 Open Arabic LLM Leaderboard(OALL),专门评估和比较阿拉伯语 LLM 性能,服务全球超 3.8 亿阿拉伯语使用者。
在 ChatGPT 发布一年多后,OpenAI 阐述了其数据与 AI 策略,并面向创作者和内容所有者推出新的 Media Manager。该工具旨在应对 AI 时代的数据议题,OpenAI 同时说明了后续方向。
Hugging Face 发布专为希伯来语设计的开放 LLM 排行榜,填补低资源语言评测空白。榜单包含希伯来语问答、情感准确率、Winograd Schema Challenge 和英希翻译四项基准,采用 few-shot 提示格式评测。
Hugging Face 的 Leaderboards and Evals 团队发现,同一任务下仅改变提示词格式,模型得分波动可达约 10 分,Qwen1.5-7B 在 7 种提示变体下准确率从 51.2% 跌至 22.9%,且模型排名也随之改变。为此该团队与 .txt 合作,尝试用 Outlines 库的结构化生成约束输出,从输出端而非输入端减少提示词格式带来的方差。
Hugging Face 发布 StarCoder2-15B-Instruct-v0.1,这是首个完全自对齐、流程完全透明且许可宽松的代码大语言模型,仅用 StarCoder2-15B 自身生成指令-响应对进行微调,无需人工标注或从大型专有模型蒸馏数据。
Hugging Face 推出 Open Medical-LLM Leaderboard,用统一平台评测大语言模型在医疗任务上的表现,以准确率为主要指标,覆盖 MedQA、MedMCQA、PubMedQA 及 MMLU 医学与生物学子集。
Meta 发布 Llama 3 系列开源大模型,包含 8B 和 70B 两个尺寸,各有 base 与 instruct 版本,并推出基于 Llama 3 8B 微调的安全模型 Llama Guard 2,全部 5 个模型已上线 Hugging Face Hub。
推荐理由:Meta 发布 Llama 3 并同步接入 Hugging Face 生态,读者可了解新分词器、GQA 与 15T token 训练带来的变化。
Hugging Face 上线 LiveCodeBench 排行榜,基于 UC Berkeley、MIT 和 Cornell 研究者开发的基准,按题目发布时间窗口评估代码 LLM,以检测和防止数据污染。
MotherDuck 与 Numbers Station 推出的 DuckDB-NSQL-7B 可从自然语言生成 DuckDB SQL,该模型基于 Meta Llama-2-7b 微调,并用 DuckDB text-to-SQL 数据对进一步优化。
Harvey 与 OpenAI 合作,为法律专业人士构建了一个定制训练的模型。
Zelma 借助 GPT-4 让教育数据变得易于获取。
Hugging Face 博客介绍嵌入向量的二值(binary)与标量(int8)量化,用于降低检索的内存、磁盘占用与成本。二值量化把 float32 值转为 1-bit,内存和存储减少 32 倍,配合 rescoring 可保留约 96% 的检索性能;int8 量化缩小 4 倍,平均带来 3.66 倍检索加速,二值量化平均加速 24.76 倍。
推荐理由:原文给出二值与标量量化的实测数据与可复用脚本,读者可据此评估检索成本与性能的取舍。
Hugging Face 博客介绍 GaLore 方法,通过将梯度投影到低秩子空间,可在 NVIDIA RTX 4090 等消费级 GPU 上训练最高 7B 参数的 Llama 架构模型,作者报告优化器状态存储内存减少超过 82.5%。
推荐理由:原文给出 GaLore 在消费级 GPU 上训练 7B 模型的内存节省数据与 transformers 接入方式,便于评估落地成本。
Hugging Face 发布 Cosmopedia,一个由 Mixtral-8x7B-Instruct-v0.1 生成的合成预训练数据集,包含超 3000 万个文件、250 亿 token,并开源了端到端流水线代码、数据集和基于它训练的 1B 模型 cosmo-1b。
推荐理由:原文完整公开了从提示词构建到去污染的合成数据流水线,可据此复现或迁移到自有预训练数据生产。
Hugging Face 面向 Enterprise Hub 组织推出 Train on DGX Cloud,可在 Hub 内直接调用 NVIDIA H100 GPU 微调 Llama、Mistral、Stable Diffusion 等模型。
推荐理由:原文给出了无代码微调的具体操作路径与按分钟计费价格,读者可据此判断企业团队接入 H100 训练的成本与门槛。
UCLA 研究者推出 ConTextual,一个面向 LMM 的上下文敏感富文本视觉推理数据集,含 506 条指令,覆盖时间阅读、购物、导航、信息图等 8 类真实场景,并同步上线排行榜。
Argilla 与 Hugging Face 推出 Data is Better Together 实验,几天内吸引 350 名社区贡献者完成超 11,000 条 prompt 评分,并发布含 10,000 条 prompt 用户评分的 10k_prompts_ranked 数据集。
BigCode 发布新一代透明训练的开放代码大模型 StarCoder2,包含 3B、7B、15B 三个尺寸,分别由 ServiceNow、Hugging Face 和 NVIDIA 训练。
推荐理由:BigCode 公开了 StarCoder2 三个尺寸的模型、训练数据与训练代码,读者可据此了解开源代码模型的数据规模与开放程度。
OpenAI 探索在视频数据上大规模训练生成模型,将文本条件扩散模型联合训练于不同时长、分辨率和宽高比的视频与图像,并采用在视频和图像潜码时空 patch 上运行的 Transformer 架构。其最大模型 Sora 能生成一分钟高保真视频,结果提示扩展视频生成模型是构建通用物理世界模拟器的一条可行路径。
推荐理由:OpenAI 公开了视频生成模型的训练思路,读者可了解扩散模型与 Transformer 如何被用于构建物理世界模拟器。
OpenAI 推出数据合作伙伴计划,与各方合作创建用于 AI 训练的开源和私有数据集。
Mistral AI 发布首个 7B 参数模型 Mistral 7B,称其在所有标准英文与代码基准上超过当时所有 13B 参数以下的开源模型,并以 Apache 2.0 许可发布,可无限制使用。
推荐理由:Mistral AI 首次公开其开源路线与 Mistral 7B 的基准表现,可了解开放权重模型当时的性能位置。
OpenAI 与 Scale 达成合作,企业客户可借助 Scale 的 AI 专业能力微调 OpenAI 最先进的模型。
OpenAI 宣布开发者现在可以自带数据对 GPT-3.5 Turbo 进行微调,以适配自己的使用场景,同时更新了 API。
推荐理由:OpenAI 开放 GPT-3.5 Turbo 微调,开发者可用自有数据定制模型,值得关注其对应用落地方式的影响。
Viable 借助 GPT-4 以革命性规模分析定性数据,并实现前所未有的准确度。
OpenAI 使用 GPT-4 自动为大型语言模型中的神经元行为撰写解释,并对这些解释进行评分。团队公开了覆盖 GPT-2 每个神经元的解释与评分数据集,并说明这些解释并不完美。
ChatGPT 用户现在可以关闭聊天记录,从而自行选择哪些对话可以被用于训练 OpenAI 的模型。
推荐理由:ChatGPT 新增关闭聊天记录开关,用户可自行决定哪些对话被用于模型训练。
Hugging Face 博客介绍如何在 24GB 消费级 GPU 上通过 RLHF 微调 20B 大语言模型。
Hugging Face 发布用 Diffusers 的 Dreambooth 脚本微调 Stable Diffusion 的实验总结,指出 Dreambooth 容易过拟合,需要在训练步数和学习率之间找平衡,建议先用低学习率再逐步增加步数。
推荐理由:Hugging Face 基于多组对照实验给出 Dreambooth 微调 Stable Diffusion 的学习率、步数与先验保留建议,可直接迁移到自己的训练配置。
Hugging Face 推出 MTEB(Massive Text Embedding Benchmark),一个覆盖 8 类任务、56 个数据集、最多 112 种语言的文本嵌入模型评测基准,排行榜已汇总超 2000 条结果。用户可通过 `pip install mteb` 对任意嵌入模型进行评测,并将结果提交至公开排行榜。
Hugging Face 宣布用户可直接在 Hub 上为模型或数据集生成 DOI,该功能已与 DataCite 合作实现。注册用户填写必要元数据后即可获得 DOI,他人可通过模型或数据集页面上的“Cite this model/dataset”按钮引用其工作。带 DOI 的数据集和模型将被永久保留,仅可在向官方支持提交请求后删除。
Hugging Face 在 Evaluation on the Hub 上线零样本分类评测,由 AutoTrain 驱动,无需写代码即可评测 Hub 上的任意因果语言模型,目前支持最大 66B 参数模型。
Hugging Face 与 Intel Labs、UKP Lab 合作推出 SetFit,一个面向 Sentence Transformers 的高效少样本微调框架,无需提示词或 verbaliser。
推荐理由:原文给出 SetFit 的两阶段训练流程与 RAFT 基准对比,读者可了解无提示词少样本分类的实现方式与成本。
Hugging Face 发布教程,讲解如何在 NVIDIA GPU 上用 Megatron-LM 训练 GPT2 语言模型并接入 Transformers。Megatron-LM 通过高效 DataLoader、Fused CUDA Kernels 和 Apex 的 Fused AdamW 实现加速,但使用门槛高于 Accelerate 和 Trainer。
Hugging Face 发布教程,介绍如何用 3Dmol.js 和 Gradio 的 HTML 组件在 Hugging Face Spaces 中可视化蛋白质结构。用户可输入 4 位 PDB 代码或上传 PDB 文件,应用会从 RCSB Protein Databank 获取结构并渲染。文章还提到可用 Molecule3D Gradio 自定义组件简化这一流程。