Diffusers 集成 Stable Diffusion 3 Medium,2B 参数模型上线 Hugging Face Hub
Stability AI 的 Stable Diffusion 3 Medium(2B 参数)已在 Hugging Face Hub 发布,并可通过 Diffusers 调用,官方同时提供 DreamBooth 与 LoRA 训练脚本。
推荐理由:原文给出 SD3 Medium 的架构变化与 Diffusers 集成细节,读者可据此判断显存占用与推理速度的取舍。
Stability AI 的 Stable Diffusion 3 Medium(2B 参数)已在 Hugging Face Hub 发布,并可通过 Diffusers 调用,官方同时提供 DreamBooth 与 LoRA 训练脚本。
推荐理由:原文给出 SD3 Medium 的架构变化与 Diffusers 集成细节,读者可据此判断显存占用与推理速度的取舍。
Hugging Face 在 TRL 中推出 RLOO(REINFORCE Leave One-Out)Trainer,作为 PPO 的在线 RLHF 替代方案。RLOO 只需加载策略、参考策略和奖励模型 3 份模型,比 PPO 少约 50-70% 显存,1B 模型上快 2 倍、6.9B 模型上快达 3 倍,响应胜率与 PPO 相当并持续优于 DPO 等离线方法。
Hugging Face Embedding Container for Amazon SageMaker 正式 GA,AWS 用户可在 SageMaker 上部署嵌入模型构建 RAG 等生成式 AI 应用。
Hugging Face 正在重新设计 Transformers 文档,原因是新内容不断增量叠加,导致文档体验割裂、难导航且过时。改版将面向用 AI 构建产品的开发者,采用代码优先、解决方案导向的写法,并以灵活结构取代 Diátaxis 的刚性框架,让内容整合而非追加。
Artificial Analysis 推出文生图排行榜与 Image Arena,基于超 45,000 次人类图像偏好投票计算 ELO 分数,覆盖 Midjourney、DALL·E、Stable Diffusion、Playground 等主流开源与闭源模型。
Hugging Face 上线 NPC-Playground,一个由 Cubzh 和 Gigax 打造的 3D 演示,让用户在浏览器中与 LLM 驱动的 NPC 互动,并用几行 Lua 脚本教它们新技能。
Hugging Face 将辅助生成(Assisted Generation)适配并优化到 Intel Gaudi,现已集成进 Optimum Habana。该方法基于 Speculative Sampling,通过草稿模型生成 K 个 token 再由目标模型评估,对大型 Transformer 模型通常可带来约 2x 加速。
Mistral AI 发布首个代码模型 Codestral,这是一个 22B 的开源权重生成式模型,专门面向代码生成任务,支持 80+ 编程语言,包括 Python、Java、C、C++、JavaScript 和 Bash。
推荐理由:Mistral 首个代码模型给出了 22B 参数、32k 上下文与多语言基准对比,可据此判断其代码补全定位。
Hugging Face 发布 TGI Benchmarking 工具,可在 Hugging Face Space 中部署 TGI 并运行 CLI 基准测试,同时给出吞吐量与延迟数据。该工具随 TGI 安装,需访问服务器运行,通过预填充吞吐量-延迟散点图展示不同 batch size 下的权衡,帮助用户按需调优部署。
Hugging Face 发布博客,介绍如何用 Python 库 Sentence Transformers 微调嵌入向量模型,以提升其在特定任务上的表现,也可用于从零训练新模型。
TII 发布第二代 Falcon 2 模型,包括 11B 基础 LLM 和具备图像理解能力的 11B VLM,LLM 训练数据超过 5000B tokens,覆盖英语及另外十种语言。
推荐理由:TII 公布 Falcon 2 的 11B LLM 与 VLM 训练细节和评测数据,可对照同尺寸开源模型看性能与许可条件。
Hugging Face 将 AWS Inferentia2 部署能力扩展到 Hub 上超 10 万个公开模型,新增 14 种模型架构和 6 类机器学习任务,并支持在 Amazon SageMaker 上部署。
Hugging Face 宣布 AMD Instinct MI300 GPU 已在 Hugging Face 平台获得一等公民级集成,用户无需改动代码即可通过 transformers 和 text-generation-inference 在 Azure ND MI300x V5 虚拟机上部署模型。
Hugging Face 与微软在 Microsoft Build 上宣布深化战略合作,将 Llama 3、Mistral 7B、Command R Plus、Qwen 1.5 110B 等热门开源模型加入 Azure 模型目录的 Hugging Face Collection,支持一键部署。
Hugging Face Spaces 上线 Dev Mode,支持一键从 VS Code 或 SSH 直连 Space,开发者无需再用 git 推送本地改动即可编辑代码。该功能目前处于 beta 阶段,仅面向 PRO 订阅用户开放,编辑后点击 Space 中的 Refresh 即可测试,满意后再 commit 和 merge 持久化。
Hugging Face 与 Dell 联合发布 Dell Enterprise Hub,让企业在 Dell 平台上本地训练和部署开源模型,将原本数周的工程工作缩短至几分钟。
Hugging Face 在 Transformers 中新增 KV Cache 量化功能,通过降低 KV 缓存精度减少长上下文生成的内存占用,对生成质量影响很小。
Hugging Face 与 LangChain 联合发布合作包 langchain-huggingface,可通过 pip install langchain-huggingface 安装。
Hugging Face 发布 Open Arabic LLM Leaderboard(OALL),专门评估和比较阿拉伯语 LLM 性能,服务全球超 3.8 亿阿拉伯语使用者。
Google 发布视觉语言模型家族 PaliGemma,由 SigLIP-So400m 图像编码器和 Gemma-2B 文本解码器组成,可输入图像和文本并输出文本。
推荐理由:原文给出 PaliGemma 的架构、三种 checkpoint 与微调代码,读者可据此判断它适合哪些视觉语言任务。
Hugging Face 发布 Transformers Agents 2.0,在原有 agent 类型之上新增两种可基于历史观察迭代的 agent,并加入社区 agent 分享功能。
推荐理由:官方披露了 Agents 2.0 的模块化设计与 GAIA 榜单成绩,读者可据此判断开源智能体框架的可用边界。
Hugging Face 现已支持通过 AWS 账户将组织升级至 Enterprise Hub,订阅入口在 AWS Marketplace,定价与 Hugging Face 公开价格一致,但账单由 AWS 账户结算。
Intel 在 OPEA 平台下展示了用 Gaudi 2 AI 加速器和 Xeon CPU 构建企业级 RAG 应用的方案,LLM 跑在 Gaudi 2 上、嵌入模型跑在 Granite Rapids CPU 上。
Hugging Face 发布专为希伯来语设计的开放 LLM 排行榜,填补低资源语言评测空白。榜单包含希伯来语问答、情感准确率、Winograd Schema Challenge 和英希翻译四项基准,采用 few-shot 提示格式评测。
Artificial Analysis 开发的 LLM 性能排行榜现已登陆 Hugging Face,覆盖超 100 个 serverless LLM API 端点,综合评估质量、价格与速度。
Hugging Face Inference Endpoints 通过自定义 inference handler,把 Whisper ASR、Pyannote 说话人分离和推测解码组合在单个 API 端点中。
Hugging Face 的 Leaderboards and Evals 团队发现,同一任务下仅改变提示词格式,模型得分波动可达约 10 分,Qwen1.5-7B 在 7 种提示变体下准确率从 51.2% 跌至 22.9%,且模型排名也随之改变。为此该团队与 .txt 合作,尝试用 Outlines 库的结构化生成约束输出,从输出端而非输入端减少提示词格式带来的方差。
Hugging Face 发布 StarCoder2-15B-Instruct-v0.1,这是首个完全自对齐、流程完全透明且许可宽松的代码大语言模型,仅用 StarCoder2-15B 自身生成指令-响应对进行微调,无需人工标注或从大型专有模型蒸馏数据。
Hugging Face 发布 Open CoT Leaderboard,不评模型绝对准确率,而是对比有无链式推理提示下的准确率差值 Δ。该榜单覆盖 LogiQA、LSAT 等 AGIEval 任务,目前实现 Classic 与 Reflect 两种提示策略,Mixtral-8x7B-Instruct-v0.1 已参与评测。
Hugging Face 发布 JAT(Jack of All Trades),一个基于 GPT-Neo 架构的多模态 Transformer 智能体,用单一网络在 157 项训练任务上达到专家平均性能的 65.8%。
Hugging Face 推出 Open Medical-LLM Leaderboard,用统一平台评测大语言模型在医疗任务上的表现,以准确率为主要指标,覆盖 MedQA、MedMCQA、PubMedQA 及 MMLU 医学与生物学子集。
Meta 发布 Llama 3 系列开源大模型,包含 8B 和 70B 两个尺寸,各有 base 与 instruct 版本,并推出基于 Llama 3 8B 微调的安全模型 Llama Guard 2,全部 5 个模型已上线 Hugging Face Hub。
推荐理由:Meta 发布 Llama 3 并同步接入 Hugging Face 生态,读者可了解新分词器、GQA 与 15T token 训练带来的变化。
Ryght 正式发布面向生命科学知识工作者的免费安全平台 Ryght Preview,并借助 Hugging Face 专家支持计划加速其企业级生成式 AI 平台开发。
Hugging Face 上线 LiveCodeBench 排行榜,基于 UC Berkeley、MIT 和 Cornell 研究者开发的基准,按题目发布时间窗口评估代码 LLM,以检测和防止数据污染。
Zama 将 Concrete ML 预编译模型部署到 Hugging Face Endpoints,通过自定义 inference handler 实现一键部署,用户可直接在加密数据上运行 FHE 推理而无需解密。
Gradio 推出 reload 模式,用 `gradio app.py` 替代 `python app.py` 启动应用,即可在不重启服务器的情况下拉取源码最新改动。
Hugging Face 发布 Idefics2,一个 8B 参数的通用多模态模型,可接受任意文本与图像序列输入并生成文本回复,采用 Apache 2.0 开源许可。
推荐理由:8B 参数、Apache 2.0 开源,并给出与更大模型的基准对比和微调入口,便于判断多模态选型。
Hugging Face 发布视觉语言模型入门指南,梳理了 LLaVA 1.6、CogVLM、Qwen-VL、Fuyu-8B、KOSMOS-2 等开源 VLM 的模型规模、图像分辨率与 grounding 等能力,并介绍 Vision Arena、Open VLM Leaderboard 及 MMMU、MMBench 等评测基准。
Hugging Face 推出 Deploy on Google Cloud,可将 Hub 上数千个基础模型一键部署到 Google Cloud 的 Vertex AI 或 GKE,并作为自有账号内的 API Endpoint 运行。
Google 发布 CodeGemma 系列开源代码模型,包含 2B 基础模型、7B 基础模型和 7B Instruct 三个版本,基于预训练的 2B 和 7B Gemma checkpoint 额外训练 5000 亿 token 的英文、数学和代码数据。
推荐理由:Google 与 Hugging Face 联合发布三个开源代码模型,读者可对照 HumanEval 等基准数据判断其与同尺寸模型的差距。