Public AI 成为 Hugging Face Inference Providers 新成员
Public AI 现已作为 Inference Provider 接入 Hugging Face Hub,用户可直接调用 Swiss AI Initiative、AI Singapore 等机构的公共主权模型。
Public AI 现已作为 Inference Provider 接入 Hugging Face Hub,用户可直接调用 Swiss AI Initiative、AI Singapore 等机构的公共主权模型。
Hugging Face 官方博客介绍了为支持 OpenAI gpt-oss 系列而在 transformers 中做的一系列升级,包括可从 Hub 下载的零构建内核、MXFP4 量化、张量并行、专家并行、动态滑动窗口缓存、连续批处理与分页注意力,以及更快的模型加载。
Together AI 与 Hugging Face 联合推出新能力,Hub 上任意兼容 LLM 均可通过 Together AI 基础设施微调,训练后可部署推理、下载或回传 Hub。该功能支持公开与私有仓库,100B 参数以下的 CausalLM 模型均可使用,只需几行 API 调用即可完成。Slingshot AI 等早期用户已将其接入模型开发流程,加速迭代周期。
Hugging Face 介绍如何在 ZeroGPU Spaces 中接入 PyTorch 提前(AoT)编译,让模型只编译一次即可即时重载,在 Flux、Wan、LTX 等模型上获得 1.3×–1.8× 加速。
Hugging Face 发布 kernel-builder 库,让开发者可在本地开发自定义 CUDA kernel,再针对多种架构构建并发布到 Hugging Face Hub 供他人通过 get_kernel 直接调用。
Cursor 分享了其使用 GPT-5 的方式。
Mistral 用 LoRA 微调 Pixtral-12B 处理卫星图像分类,在 Aerial Image Dataset(8000 训练样本、2000 测试样本)上显著优于未微调基线,并减少了模型幻觉出的无效类别名。
OpenAI 在 OpenAI for Countries 计划下启动 Stargate Norway,这是其欧洲首个 AI 数据中心项目。Stargate 是 OpenAI 的整体基础设施平台,也是其长期愿景的关键部分,旨在让所有人受益于 AI。
Intercom 分享了构建可扩展 AI 平台的三条经验,涵盖评估与架构等环节,目标是引领未来客户支持。
Mistral AI 与 Carbone 4、法国生态转型署(ADEME)合作完成首个 AI 模型全生命周期分析,并披露 Mistral Large 2 截至 2025 年 1 月的环境影响:训练加 18 个月使用共产生 20.4 ktCO₂e、消耗 281 000 m³ 水和 660 kg Sb eq。
OpenAI 与 Oracle 达成协议,将在美国开发 4.5 GW 的额外 Stargate 数据中心容量。OpenAI 称这笔投资将创造就业、加速美国再工业化,并推动美国在 AI 领域的领先地位,同时是 Stargate 这一 AI 基础设施平台的重要里程碑。
推荐理由:OpenAI 与 Oracle 新增 4.5 GW Stargate 数据中心容量的协议,可了解其美国 AI 基础设施布局的规模。
Mistral AI 发布 Mistral Compute,提供从裸金属服务器到全托管 PaaS 的私有集成 AI 基础设施栈,涵盖 GPU、编排、API 与产品服务。
推荐理由:Mistral 把自建训练平台对外产品化,读者可了解欧洲主权 AI 基础设施的一种落地路径。
Mistral 发布企业级 AI 编码助手 Mistral Code,将模型、IDE 插件、本地部署选项和企业工具打包为一体化方案,基于开源项目 Continue 构建,今日面向 JetBrains IDE 和 VSCode 开放私测,正式版计划随后推出。
推荐理由:Mistral 把编码模型、IDE 插件与企业管控打包成可本地部署的方案,读者可据此判断企业级编码助手的落地路径。
Mistral AI 发布首款专为代码设计的嵌入模型 Codestral Embed,在真实代码数据检索任务上优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大型嵌入模型。
OpenAI 宣布推出 Stargate UAE,这是其 AI 基础设施平台 Stargate 的首次国际部署。
推荐理由:OpenAI 公布 Stargate 首次海外落地阿联酋,读者可据此了解其 AI 基础设施的国际化布局。
OpenAI 在亚洲推出数据驻留功能,延续其面向全球客户的企业级数据隐私、安全与合规体系。
Mistral AI 发布 Mistral Medium 3,定位兼顾 SOTA 性能与更低成本,定价为每百万 token 输入 0.4 美元、输出 2 美元。
推荐理由:官方给出 Mistral Medium 3 的定价、对标模型与部署门槛,便于判断企业自部署的性价比。
Mistral AI 发布 Le Chat Enterprise,一款由全新 Mistral Medium 3 模型驱动的企业级 AI 助手,包含企业搜索、Agent 构建器、自定义数据与工具连接器、文档库、自定义模型和混合部署等功能,全部功能将在未来两周内陆续上线。
推荐理由:官方披露了 Le Chat Enterprise 的功能清单与部署选项,可据此判断企业级 AI 助手的集成与私有化路径。
Mistral AI 发布光学字符识别 API Mistral OCR,可接收图片和 PDF,按顺序交错输出文本与图像,并已作为 Le Chat 文档理解的默认模型。
推荐理由:官方给出 Mistral OCR 的定价、基准对比与自托管选项,可据此判断多模态文档解析在 RAG 流程中的落地成本。
OpenAI 将工程周期加速了 20%。
Mistral AI 发布 Mistral Saba,这是其首个专门面向区域语言的模型,24B 参数,基于中东和南亚地区精选数据集训练。官方称其回答比体积超过自身 5 倍的模型更准确相关,速度更快、成本更低,可在单 GPU 系统上部署,响应速度超过 150 tokens per second,支持阿拉伯语和多种印度语系语言,在泰米尔语等南印度语系上表现尤其突出。
推荐理由:Mistral 首个区域语言模型给出 24B 参数、单 GPU 部署与 150 tokens/s 速度,可对照其区域化路线。
OpenAI 面向欧洲客户推出数据驻留功能,允许其数据存储在欧洲本地。该功能建立在 OpenAI 面向全球客户的企业级数据隐私、安全与合规体系之上。
Mistral AI 发布 Codestral 25.01,采用更高效的架构和改进的 tokenizer,生成与补全代码速度约为原版 Codestral 的 2 倍,上下文长度从 32k 提升到 256k。
推荐理由:官方给出 Codestral 25.01 的架构与 tokenizer 变化、256k 上下文和多项基准对比,可据此判断它在代码补全场景的位置。
Mistral 在 La Plateforme 上线 Batch API,处理高并发请求的成本比同步 API 调用低 50%。用户上传批处理文件、待请求处理完成后下载输出文件即可,适用于情感分析、批量文档摘要与翻译、向量嵌入和数据标注等场景。该 API 已面向 La Plateforme 上所有模型开放,每个工作区最多 100 万个进行中的请求,并将陆续登陆其云服务商合作伙伴。
OpenAI 在 API 中推出提示词缓存(Prompt Caching),对模型近期已见过的输入自动提供折扣。该功能面向 API 用户,无需额外配置即可享受输入 token 的自动降价。
Mercado Libre 推出 AI 开发平台 Verdi,该平台由 GPT-4o 驱动。
Mistral 宣布 la Plateforme 推出免费额度,并对全线模型降价,其中 Mistral Small 和 Codestral 输入输出价格均下降 80%,Mistral Large 下降 33%。
推荐理由:Mistral 一次性公布免费额度、全线降价和新版小模型,读者可据此重估自建与调用成本。
OpenAI 发布了从数百个成功部署中总结的 AI 落地经验,为企业提供将 AI 投入实际工作的实践参考。内容聚焦于真实部署案例中的经验教训,帮助企业更顺利地推进 AI 项目落地。
Hugging Face 博客盘点了 Hub 上 5 个常被忽视的工具:ZeroGPU、多进程 Docker、Gradio API、Webhooks 和 Nomic Atlas。
Hugging Face Transformers 新增 DataCollatorWithFlattening,使无 padding 的 packing 训练与 Flash Attention 2 兼容,避免跨样本注意力。
Hugging Face 发布教程,介绍如何用 TGI 和专用深度学习容器(DLC)在 Google Cloud Vertex AI 的 A3 节点(8 张 H100 GPU)上部署 FP8 量化的 Meta Llama 3.1 405B Instruct。
Hugging Face 发布 ggml 入门指南,介绍这个用 C/C++ 编写、专注 Transformer 推理的开源 ML 库。ggml 核心库自包含在不到 5 个文件中,编译后二进制小于 1MB,支持 x86_64、ARM、Apple Silicon、CUDA 等硬件及量化张量。ollama、LM Studio、GPT4All 等项目均基于 ggml 实现端侧 LLM。
Mistral AI 在 La Plateforme 上线模型定制功能,支持对 Mistral Large 2 和 Codestral 等旗舰及专用模型进行 base prompt、few-shot 提示和微调,并可自带数据集。
Hugging Face 展示了如何借助 Diffusers 库中的 Quanto 量化工具降低 Transformer 扩散模型的内存占用。以 PixArt-Sigma、Stable Diffusion 3 和 Aura Flow 为例,将扩散主干与文本编码器量化为 FP8 后,SD3 推理显存从 16.403 GB 降至 8.204 GB,质量几乎无损但延迟略有上升。
Hugging Face 面向 Enterprise Hub 组织推出 NVIDIA NIM API(无服务器),可在 Hub 内用 OpenAI 标准 API 对 Llama、Mistral 等开源模型运行推理。
Meta 发布 Llama 3.1 系列,包含 8B、70B、405B 三个尺寸的 base 与 instruct 版本共六个开放权重模型,均支持 128K token 上下文和英语、德语、法语、意大利语、葡萄牙语、印地语、西班牙语、泰语 8 种语言,并新增工具调用能力。
推荐理由:Hugging Face 官方梳理了 Llama 3.1 三个尺寸的显存需求、量化方案与微调路径,可据此估算部署成本。
Hugging Face 发布教程,介绍如何借助 WWDC 24 的新 Core ML 特性在 Mac 上运行 Mistral 7B,并用 4-bit 分块量化把模型压到约 3.8G,低于 float16 转换的 14G。
OpenAI 为 ChatGPT Enterprise 新增 Compliance API 集成、SCIM 和 GPT 控制功能,用于支持合规项目、数据安全和大规模用户访问管理。
Hugging Face 为 TGI 推出 Multi-LoRA 服务,只需部署一次基础模型,即可按请求中的 adapter_id 动态调用多个 LoRA 适配器。
推荐理由:Hugging Face 官方给出 TGI Multi-LoRA 的部署步骤与成本数据,读者可据此评估单次部署承载多适配器的可行性。
Hugging Face 与 KerasHub 实现共享模型保存格式,Hub 上 30 万+ Transformers 模型现可直接加载进 KerasHub,首批支持 Gemma 1/2、Llama 3 和 PaliGemma。