Diffusers 支持 FLUX.2,官方给出 4bit 量化推理示例
Hugging Face Diffusers 宣布支持 FLUX.2,并给出基于 diffusers/FLUX.2-dev-bnb-4bit 仓库的完整推理示例,transformer 与 Mistral3 文本编码器均以 bfloat16 加载并启用 CPU offload。
推荐理由:Diffusers 接入 FLUX.2 的示例代码与 4bit 量化仓库地址,可帮读者判断本地部署门槛与显存需求。
开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。
Hugging Face Diffusers 宣布支持 FLUX.2,并给出基于 diffusers/FLUX.2-dev-bnb-4bit 仓库的完整推理示例,transformer 与 Mistral3 文本编码器均以 bfloat16 加载并启用 CPU offload。
推荐理由:Diffusers 接入 FLUX.2 的示例代码与 4bit 量化仓库地址,可帮读者判断本地部署门槛与显存需求。
ServiceNow 的 SLAM Lab 发布 Apriel-H1,把 15B 推理模型改造成 Mamba 混合架构,旗舰版 Apriel-H1-15b-Thinker-SFT 实现 2.1 倍吞吐且质量损失很小,MATH500 从 0.90 升到 0.92、MTBench 从 8.30 升到 8.58,GSM8k、GPQA、AIME24 略有下降。
推荐理由:ServiceNow 公开了把 15B 推理模型蒸馏成 Mamba 混合架构的完整流程与七个 checkpoint,可看到效率与质量的取舍曲线。
Hugging Face 发布分析文章,指出中国开源权重模型的推理已开始由华为昇腾、寒武纪等国产芯片承载,部分模型开始用国产芯片训练。文章认为美国出口管制与中国芯片产能提速高度相关,芯片稀缺也促使 DeepSeek 的 MLA、GRPO 等算力效率创新走向开源。
推荐理由:梳理中国算力从被限制到自建全栈的路径,帮助读者理解开源模型与国产芯片如何互相推动。
Hugging Face 发布 huggingface_hub v1.0,这是该库五年来的首个大版本,带来多项破坏性变更。主要变化包括底层从 requests 迁移到 httpx、文件传输全面改用 hf_xet 取代 hf_transfer,以及用基于 Typer 的 hf CLI 替换已弃用的 huggingface-cli。
推荐理由:官方梳理了 huggingface_hub v1.0 的破坏性变更与迁移路径,可据此评估自家依赖库的升级成本。
Hugging Face 发布 datasets 与 huggingface_hub 的流式加载改进,load_dataset(streaming=True) 接口保持不变即可获得性能提升。
推荐理由:官方给出流式加载的请求量、解析速度与吞吐变化,可据此判断大规模训练的数据管线是否值得切换。
Hugging Face 发布 LeRobot v0.4.0,带来 LeRobotDataset v3.0 分块 episode 格式与流式加载,支持 OXE 级别(> 400GB)数据集,并提供 lerobot-edit-dataset CLI 用于删除、拆分、合并数据集。
推荐理由:原文列出数据集、仿真环境、多 GPU 训练与硬件插件等具体变化,读者可据此判断开源机器人学习工具链的可用性。
Meta 与 Hugging Face 合作推出 OpenEnv Hub,一个面向智能体环境的开放共享社区平台,环境定义智能体完成任务所需的工具、API、凭证和执行上下文。
推荐理由:Meta 与 Hugging Face 联合推出智能体环境共享 Hub,并同步开放 0.1 规范 RFC,读者可据此了解智能体训练与部署的标准化路径。
Hugging Face 发布指南,梳理 Chandra、OlmOCR-2、PaddleOCR-VL、DeepSeek-OCR、dots.ocr、Granite-Docling-258M。
推荐理由:梳理了当前开源 OCR 模型的输出格式、基准与本地部署方式,可据此为具体文档场景选型。
Hugging Face 发布 GAIA 的后续智能体基准 Gaia2,并配套开源 Meta Agents Research Environments(ARE)框架,用于运行、调试和评估智能体。
推荐理由:Gaia2 把智能体评测从只读检索扩展到读写交互,并给出各模型在歧义、适应性和时间推理上的差距。
Google 发布 EmbeddingGemma,一个 308M 参数、2K 上下文窗口、支持 100 多种语言的多语言嵌入模型,面向端侧场景,量化后内存占用低于 200MB。
推荐理由:原文给出 308M 参数、2K 上下文与量化后 200MB 内存等指标,可据此判断端侧多语言检索的落地空间。
OpenAI 发布其能力最强的开放权重模型,称这是让先进 AI 更开放、灵活并覆盖全球的一步。官方表示,其使命是让尽可能多的人用上 AI,此次发布是朝这一方向的重要进展。
推荐理由:OpenAI 官方说明开放权重模型发布,读者可了解其开放与可及性主张。
OpenAI 发布 gpt-oss-120b 与 gpt-oss-20b 两款开放权重语言模型,采用 Apache 2.0 许可。官方称其在推理任务上优于同规模开放模型,具备较强工具调用能力,并针对消费级硬件的高效部署做了优化。
推荐理由:OpenAI 开放权重模型以 Apache 2.0 发布,读者可据此判断消费级硬件部署与工具调用的可行边界。
OpenAI 发布 gpt-oss-120b 和 gpt-oss-20b 两款开放权重推理模型,采用 Apache 2.0 许可,并适用 gpt-oss 使用政策。
推荐理由:OpenAI 公开两款开放权重推理模型的许可与使用政策,可据此了解其开放范围与使用条件。
Hugging Face 博客发文欢迎 OpenAI 推出新的开源模型家族 GPT OSS。
Mistral AI 发布 Voxtral 语音理解模型,提供 24B 和 3B 两个版本,均以 Apache 2.0 协议开源并上线自家 API。模型支持 32k token 上下文,可处理最长 30 分钟音频转写或 40 分钟音频理解,具备内置问答与摘要、多语言自动检测和语音触发函数调用能力,并保留 Mistral Small 3.1 的文本能力。
推荐理由:官方给出两款语音理解模型的尺寸、开源协议与 API 定价,可对照 Whisper、GPT-4o mini 等基准判断其成本位置。
Mistral AI 与 All Hands AI 合作发布 Devstral Medium,并升级 Devstral Small 1.1。
推荐理由:Mistral 与 All Hands AI 合作发布两款编码智能体模型,读者可据此了解开源编码模型在 SWE-Bench Verified 上的最新位置与定价。
Hugging Face 博客宣布 Gemma 3n 已在开源生态中全面开放。
Mistral AI 发布首款推理模型 Magistral,分为 24B 参数的开源版 Magistral Small 和企业版 Magistral Medium。
推荐理由:Mistral 首款推理模型同时给出开源权重与企业版,并公开训练与强化学习细节,便于对比其推理路线。
Mistral AI 与 All Hands AI 合作发布面向软件工程任务的智能体 LLM Devstral,以 Apache 2.0 许可开源。
推荐理由:官方给出 Devstral 在 SWE-Bench Verified 的分数与开源许可,读者可据此判断它能否用于本地或企业代码智能体。
Hugging Face 发布博客欢迎 Llama 4 Maverick 与 Scout 上线,正文内容未能获取。