Mistral AI 发布 Mistral Small 3.1,支持多模态与 128k 上下文
Mistral AI 发布 Mistral Small 3.1,在 Mistral Small 3 基础上提升文本性能与多模态理解,上下文窗口扩展至 128k tokens,推理速度达 150 tokens 每秒,以 Apache 2.0 许可开源。
推荐理由:官方给出 Mistral Small 3.1 的基准对比、128k 上下文与单卡部署门槛,可据此判断小模型选型。
Mistral AI 发布 Mistral Small 3.1,在 Mistral Small 3 基础上提升文本性能与多模态理解,上下文窗口扩展至 128k tokens,推理速度达 150 tokens 每秒,以 Apache 2.0 许可开源。
推荐理由:官方给出 Mistral Small 3.1 的基准对比、128k 上下文与单卡部署门槛,可据此判断小模型选型。
Google 发布 Gemma 3,官方将其定位为多模态、多语言、长上下文的开源大模型。Hugging Face 博客以“Welcome Gemma 3”为题介绍该模型,原文正文未抓取到,具体参数与能力细节暂缺。
Hugging Face 博客发布 LeRobot 相关新内容,标题称其为全球最大的开源自动驾驶数据集。
Hugging Face 发布开源项目 DeepResearch,将搜索智能体开放出来供免费使用。
Mistral AI 发布 Mistral Small 3,一个 24B 参数、Apache 2.0 许可的延迟优化模型,官方称其性能与 Llama 3.3 70B instruct 相当,同硬件上速度超过 3 倍。
推荐理由:24B 模型对标 3 倍参数竞品并给出本地部署门槛,可据此判断小模型在自有硬件上的可用边界。
Hugging Face 发布 Open-R1,对 DeepSeek-R1 进行完全开源的复现。原文正文抓取失败,仅标题可用。
Hugging Face 发布 ModernBERT,称其为 BERT 的替代方案。
Hugging Face 发布 Falcon 3 系列开源模型。
Mistral AI 发布 Pixtral Large,一个基于 Mistral Large 2 构建的 124B 开放权重多模态模型,含 1B 参数视觉编码器和 128K 上下文窗口,可容纳至少 30 张高分辨率图像。
推荐理由:原文给出 Pixtral Large 的基准成绩与开放权重入口,读者可据此判断开源多模态模型与闭源前沿的差距。
Hugging Face 博客盘点了 Hub 上 5 个常被忽视的工具:ZeroGPU、多进程 Docker、Gradio API、Webhooks 和 Nomic Atlas。
Hugging Face Transformers 新增 DataCollatorWithFlattening,使无 padding 的 packing 训练与 Flash Attention 2 兼容,避免跨样本注意力。
Hugging Face 发布 ggml 入门指南,介绍这个用 C/C++ 编写、专注 Transformer 推理的开源 ML 库。ggml 核心库自包含在不到 5 个文件中,编译后二进制小于 1MB,支持 x86_64、ARM、Apple Silicon、CUDA 等硬件及量化张量。ollama、LM Studio、GPT4All 等项目均基于 ggml 实现端侧 LLM。
Hugging Face 宣布收购西雅图公司 XetHub,其 12 人团队将加入并帮助 Hub 从 Git LFS 切换到自研的存储与版本管理后端。XetHub 的分块存储与去重技术可让 10GB Parquet 文件只重传新增行所在的少量分块,GGUF 模型文件改一个元数据值也只需重传几 KB。
推荐理由:Hugging Face 收购 XetHub 并计划替换 Git LFS 存储后端,读者可了解 Hub 大文件版本管理将如何变化。
Meta 发布 Llama 3.1 系列,包含 8B、70B、405B 三个尺寸的 base 与 instruct 版本共六个开放权重模型,均支持 128K token 上下文和英语、德语、法语、意大利语、葡萄牙语、印地语、西班牙语、泰语 8 种语言,并新增工具调用能力。
推荐理由:Hugging Face 官方梳理了 Llama 3.1 三个尺寸的显存需求、量化方案与微调路径,可据此估算部署成本。
Hugging Face 发布教程,介绍如何借助 WWDC 24 的新 Core ML 特性在 Mac 上运行 Mistral 7B,并用 4-bit 分块量化把模型压到约 3.8G,低于 float16 转换的 14G。
Hugging Face 为 TGI 推出 Multi-LoRA 服务,只需部署一次基础模型,即可按请求中的 adapter_id 动态调用多个 LoRA 适配器。
推荐理由:Hugging Face 官方给出 TGI Multi-LoRA 的部署步骤与成本数据,读者可据此评估单次部署承载多适配器的可行性。
Hugging Face 发布 Docmatix,一个包含 240 万张图像、950 万问答对(源自 130 万份 PDF)的文档视觉问答数据集,规模是此前数据集的 240 倍。
Mistral AI 发布专攻 STEM 的数学推理模型 Mathstral 7B,基于 Mistral 7B,在 MATH 上得分 56.6%、MMLU 上得分 63.47%。
Numina 与 Hugging Face 合作的 NuminaMath 7B TIR 赢得首届 AIMO 进步奖,在私有测试集 50 题中解出 29 题。方案基于 DeepSeekMath-Base 7B 做两阶段微调,先学自然语言链式推理,再用 GPT-4 生成的工具集成推理数据训练模型调用 Python REPL。
推荐理由:NuminaMath 团队复盘了夺冠方案的两阶段微调、SC-TIR 解码与内部验证集设计,可供做数学推理微调的人参考。
Hugging Face 与 KerasHub 实现共享模型保存格式,Hub 上 30 万+ Transformers 模型现可直接加载进 KerasHub,首批支持 Gemma 1/2、Llama 3 和 PaliGemma。
Banque des Territoires、Polyconseil 与 Hugging Face 合作,为法国 EduRénov 校园生态改造计划搭建基于 RAG 的主权数据方案,项目第一阶段已完成。
Hugging Face 为 Dataset Hub 的数据集搜索新增按模态、大小、格式和库四项筛选功能,可按文本、图像、音频等模态及最小/最大行数过滤,超过 10B 行的数据集也能被检索到。
Hugging Face 用 Transformers Agents 构建的 Code Agent 在 GAIA 基准验证集上取得 44.2%,排名第一,比第二名高 4 分;测试集得分 33.3%,排名第二,并在 Level 3 难题上取得最佳平均分。
推荐理由:原文公开了 Code Agent 在 GAIA 上的完整实现细节与得分,可据此了解代码动作相对 动作的取舍。
Google 发布 Gemma 2 系列开源大模型,包含 9B 和 27B 两个尺寸的基座版与指令微调版共 4 个开放权重模型,上下文长度 8K tokens,采用允许商用和再分发的宽松许可。
推荐理由:梳理 Gemma 2 的滑窗注意力、软截断与蒸馏等训练细节,并给出与 Llama 3、Qwen 1.5 的基准对比。
Hugging Face 与 Argilla 合作的 Data Is Better Together 计划已产出 DIBT/10k_prompts_ranked 数据集,由 385 人参与完成 1 万条合成与人工提示词的质量排序,并被用于训练 SPIN 等新模型。
Stability AI 的 Stable Diffusion 3 Medium(2B 参数)已在 Hugging Face Hub 发布,并可通过 Diffusers 调用,官方同时提供 DreamBooth 与 LoRA 训练脚本。
推荐理由:原文给出 SD3 Medium 的架构变化与 Diffusers 集成细节,读者可据此判断显存占用与推理速度的取舍。
Hugging Face 正在重新设计 Transformers 文档,原因是新内容不断增量叠加,导致文档体验割裂、难导航且过时。改版将面向用 AI 构建产品的开发者,采用代码优先、解决方案导向的写法,并以灵活结构取代 Diátaxis 的刚性框架,让内容整合而非追加。
Mistral AI 在 la Plateforme 上线模型定制功能,提供三个入口:开源微调代码库 mistral-finetune、平台上的无服务器微调服务,以及面向特定客户的定制训练服务。
推荐理由:Mistral 同时给出开源微调代码库与托管微调服务,读者可据此比较自建与托管两条落地路径。
Hugging Face 上线 NPC-Playground,一个由 Cubzh 和 Gigax 打造的 3D 演示,让用户在浏览器中与 LLM 驱动的 NPC 互动,并用几行 Lua 脚本教它们新技能。
Mistral AI 发布非生产许可 MNPL,允许开发者将技术用于非商业用途并支持研究工作,Codestral 于当日在该许可下发布。Mistral 表示,此举意在让基于其技术开展业务的一方以公平可持续的方式行事,同时公司会继续以 Apache 2.0 发布模型和代码,并逐步整合 Apache 2.0 与 MNPL 两条产品线。
推荐理由:Mistral 推出 MNPL 非生产许可,读者可了解其开源与商业化的边界如何重新划分。
TII 发布第二代 Falcon 2 模型,包括 11B 基础 LLM 和具备图像理解能力的 11B VLM,LLM 训练数据超过 5000B tokens,覆盖英语及另外十种语言。
推荐理由:TII 公布 Falcon 2 的 11B LLM 与 VLM 训练细节和评测数据,可对照同尺寸开源模型看性能与许可条件。
Hugging Face 宣布 AMD Instinct MI300 GPU 已在 Hugging Face 平台获得一等公民级集成,用户无需改动代码即可通过 transformers 和 text-generation-inference 在 Azure ND MI300x V5 虚拟机上部署模型。
Hugging Face 与微软在 Microsoft Build 上宣布深化战略合作,将 Llama 3、Mistral 7B、Command R Plus、Qwen 1.5 110B 等热门开源模型加入 Azure 模型目录的 Hugging Face Collection,支持一键部署。
Hugging Face 与 Dell 联合发布 Dell Enterprise Hub,让企业在 Dell 平台上本地训练和部署开源模型,将原本数周的工程工作缩短至几分钟。
Hugging Face 在 Transformers 中新增 KV Cache 量化功能,通过降低 KV 缓存精度减少长上下文生成的内存占用,对生成质量影响很小。
Hugging Face 与 LangChain 联合发布合作包 langchain-huggingface,可通过 pip install langchain-huggingface 安装。
Hugging Face 发布 Open Arabic LLM Leaderboard(OALL),专门评估和比较阿拉伯语 LLM 性能,服务全球超 3.8 亿阿拉伯语使用者。
Google 发布视觉语言模型家族 PaliGemma,由 SigLIP-So400m 图像编码器和 Gemma-2B 文本解码器组成,可输入图像和文本并输出文本。
推荐理由:原文给出 PaliGemma 的架构、三种 checkpoint 与微调代码,读者可据此判断它适合哪些视觉语言任务。
Hugging Face 发布 Transformers Agents 2.0,在原有 agent 类型之上新增两种可基于历史观察迭代的 agent,并加入社区 agent 分享功能。
推荐理由:官方披露了 Agents 2.0 的模块化设计与 GAIA 榜单成绩,读者可据此判断开源智能体框架的可用边界。
Hugging Face 发布专为希伯来语设计的开放 LLM 排行榜,填补低资源语言评测空白。榜单包含希伯来语问答、情感准确率、Winograd Schema Challenge 和英希翻译四项基准,采用 few-shot 提示格式评测。