Transformers.js v4 发布并上线 NPM
Hugging Face 发布 Transformers.js v4,已上线 NPM,可通过 npm i @huggingface/transformers 安装。
推荐理由:官方披露了 WebGPU 运行时重写、构建提速与包体积变化,可据此判断浏览器端本地推理的工程成熟度。
Hugging Face 发布 Transformers.js v4,已上线 NPM,可通过 npm i @huggingface/transformers 安装。
推荐理由:官方披露了 WebGPU 运行时重写、构建提速与包体积变化,可据此判断浏览器端本地推理的工程成熟度。
Google Research 提出 Sequential Attention,用贪心选择机制在单次训练中顺序、自适应地挑选最佳组件,把子集选择直接整合进模型训练,避免传统贪心算法带来的数量级训练开销。该方法在多个神经网络基准上取得 SOTA,并实现快速单遍贪心选择,可用于特征选择、嵌入维度调优和权重剪枝,兼顾效率、精度、可解释性与可扩展性。
中国开源模型社区已近乎一致转向 MoE 架构,Kimi K2、MiniMax M2、Qwen3 均采用该路线,以在成本约束下兼顾能力与灵活部署。开源活动从文本扩展到多模态与智能体,StepFun 的 Step-Audio-R1.1 语音模型性能超越闭源模型,腾讯开源 Hunyuan Video 与 Hunyuan 3D。
OpenAI 通过副本、缓存、限流和工作负载隔离,将 PostgreSQL 扩展至每秒数百万次查询,以支撑 8 亿 ChatGPT 用户。文章披露了这套架构在副本、缓存、限流与工作负载隔离方面的具体做法。
Mistral AI 团队在 vLLM 上排查一起内存泄漏,问题只在 Mistral Medium 3.1、开启图编译的 Prefill/Decode 分离部署中出现,系统内存以每分钟 400 MB 线性增长,数小时后触发 out of memory。Memray、Guppy 3 均未发现泄漏,Heaptrack 显示堆内存稳定但峰值 RSS 存在差异,说明泄漏发生在堆之外。
Overworld 发布实时交互式视频扩散模型 Waypoint-1,可通过文本、鼠标和键盘控制,权重已上传 Hugging Face Hub,先开放 Waypoint-1-Small,Medium 版本即将推出。
推荐理由:Waypoint-1 把实时交互式视频扩散模型和推理库一并开源,读者可据此了解世界模型从控制输入到消费级硬件落地的路径。
OpenAI 发布《构建 AI Agent 实用指南》,系统讲解 AI Agent 的设计、编排与部署。内容覆盖用例选择、模型选型、工具设计、护栏设置以及多 Agent 模式等关键环节,为开发者落地 AI Agent 提供一站式参考。
OpenAI 与软银集团合作 SB Energy,开发多吉瓦级 AI 数据中心园区,其中包括一座 1.2 GW 的得州设施,用于支持 Stargate 计划。
NVIDIA 在 CES 2026 发布博客,给出用 DGX Spark 与 Reachy Mini 搭建桌面个人智能体的分步教程,演示代码已开源。
Mistral AI 发布 Mistral OCR 3,在表单、扫描件、复杂表格和手写内容上相对 Mistral OCR 2 的整体胜率为 74%。
推荐理由:官方给出与 Mistral OCR 2 的胜率对比、每千页定价和自托管选项,便于评估文档解析成本与合规。
llama.cpp server 新增 router 模式,可在不重启服务的情况下动态加载、卸载和切换多个模型,实现类似 Ollama 的模型管理。
推荐理由:llama.cpp server 新增 router 模式,读者可了解本地多模型动态加载与切换的具体用法和配置项。
Hugging Face 推出 Swift 包 swift-huggingface,为 Hub 提供完整客户端,可独立使用,后续将并入 swift-transformers 替换现有 HubApi。它支持断点续传与进度追踪、与 Python 生态共享的缓存结构、TokenProvider 认证模式和 OAuth 2.0,Xet 存储后端支持即将上线。
Hugging Face 发布 Transformers v5.0.0rc-0,距 v4 首个候选版已五年,如今该库每天通过 pip 安装超过 300 万次,累计安装量超过 12 亿次。
推荐理由:官方梳理了 v5 在模型定义、训练、推理与量化上的取舍,可据此判断现有工作流是否需要迁移。
OpenAI 为 ChatGPT Enterprise、ChatGPT Edu 和 API Platform 扩展数据驻留,符合条件的客户可将静态数据存储在本地区域。
Hugging Face 发布博客,从注意力机制与 KV 缓存出发,推导出 continuous batching 这一推理优化技术。该方法通过并行处理多个对话、完成即换出,来最大化高负载场景下的吞吐量。文中指出注意力是 token 间唯一交互之处,其计算量随序列长度呈平方增长。
Tavily 分享了构建 SOTA 深度研究智能体的经验:七个月前其第一版架构因假设过于复杂,在下一代模型到来时成为瓶颈,团队被迫推倒重建。新方案简化编排逻辑、强调自主性,并借助 Tavily Advanced Search 在工具侧完成上下文工程,只返回最相关内容块以降低模型幻觉与延迟。团队还提出将工具输出蒸馏为反思、仅在生成最终交付物时注入原始信息,以模拟人类研究方式管理上下文窗口。
OVHcloud 成为 Hugging Face Hub 支持的 Inference Provider,用户可直接在模型页调用 gpt-oss、Qwen3、DeepSeek R1、Llama 等开源权重模型。
Google 设计了一个基于线性回归的轻量模型,预测某充电站在未来若干分钟后仍有空闲充电桩的概率,用于将充电站纳入 EV 导航路线以缓解续航焦虑。该模型仅以一天中的小时作为特征,在 30 至 60 分钟预测窗口、至少 6 个充电桩的站点上,表现优于"保持当前状态"这一强基线,主要靠识别高占用周转的少数关键时刻。
OpenAI 与富士康达成合作,将在美国设计并制造下一代 AI 基础设施硬件。双方将共同开发多代数据中心系统,强化美国供应链,并在本土生产关键组件,以加速先进 AI 基础设施建设。
AnyLanguageModel 是一个 Swift 包,作为 Apple Foundation Models 框架的 drop-in 替代,只需把 import FoundationModels 换成 import AnyLanguageModel 即可保持同一套 API。
Mistral AI 宣布与 SAP 建立多年合作,为德国和欧洲提供完全主权的 AI 技术栈,将其模型集成进 SAP 的 AI Foundation,并联合开发面向复杂行业与政府机构的定制方案。同时与 Helsing 合作加速面向国防与安全应用的视觉-语言-动作模型研发。Mistral AI 还将大幅扩充德国本地团队,并于未来数月内在德国开设办公室。
Hugging Face 的 kernels 库支持用 kernel-builder 构建并分享 ROCm 内核,可运行在 AMD GPU 上并集成进 PyTorch。指南以 RadeonFlow 的 FP8 GEMM 内核为例,该内核针对 AMD Instinct MI300X 优化,采用 e4m3fnuz 格式与分块缩放,曾获 AMD Developer Challenge 2025 大奖。
Hugging Face 宣布与 Google Cloud 建立更深层合作,让企业用开放模型构建自己的 AI。
Google 发布 JAX-Privacy 1.0,这是构建在 JAX 之上、用于大规模机器学习差分隐私训练的模块化工具库。新版本集成最新 DP 算法研究成果,支持 DP-SGD、DP-FTRL 及 DP matrix factorization 等方法,并借助 JAX 的 vmap、shard_map 实现数据与模型并行,可在多加速器和超算上训练大模型。
Google 公布研究项目 Project Suncatcher,设想由太阳能卫星组成星座、搭载 Google TPU 并通过自由空间光链路互联,以在太空扩展 AI 算力。
推荐理由:Google 公开了太空 AI 基础设施的预印本,给出卫星互联、轨道与 TPU 抗辐射的实测数据,可了解这一设想的技术边界。
OpenAI 与 AWS 达成多年期、金额 380 亿美元的战略合作,用于扩展先进 AI 工作负载。AWS 将提供基础设施和算力,支撑 OpenAI 下一代模型。
推荐理由:原文披露了 380 亿美元多年期合作与算力供给安排,读者可据此了解 OpenAI 的算力来源布局。
Hugging Face 发布分析文章,指出中国开源权重模型的推理已开始由华为昇腾、寒武纪等国产芯片承载,部分模型开始用国产芯片训练。文章认为美国出口管制与中国芯片产能提速高度相关,芯片稀缺也促使 DeepSeek 的 MLA、GRPO 等算力效率创新走向开源。
推荐理由:梳理中国算力从被限制到自建全栈的路径,帮助读者理解开源模型与国产芯片如何互相推动。
NVIDIA Isaac for Healthcare v0.4 发布基于 SO-ARM 的端到端入门工作流,覆盖数据采集、GR00T N1.5 后训练与真机部署,可构建自主手术助手机器人。
Hugging Face 发布 huggingface_hub v1.0,这是该库五年来的首个大版本,带来多项破坏性变更。主要变化包括底层从 requests 迁移到 httpx、文件传输全面改用 hf_xet 取代 hf_transfer,以及用基于 Typer 的 hf CLI 替换已弃用的 huggingface-cli。
推荐理由:官方梳理了 huggingface_hub v1.0 的破坏性变更与迁移路径,可据此评估自家依赖库的升级成本。
Mistral AI 发布 AI Studio,一个面向企业团队的生产 AI 平台,由 Observability、Agent Runtime 和 AI Registry 三大支柱组成。
推荐理由:原文完整交代了三大支柱的能力边界与私有 beta 入口,读者可据此判断企业级 AI 生产化工具链的构成。
Intel 与 Hugging Face 联合测试显示,在搭载 Intel Xeon 6 处理器(Granite Rapids)的 Google Cloud C4 虚拟机上运行 OpenAI GPT OSS 大模型,总拥有成本(TCO)较上一代 C3 实例提升 1.7 倍,即 70%。
Hugging Face 博客给出用 Optimum Intel 和 OpenVINO 在 Intel CPU 上本地运行 SmolVLM2-256M-Video-Instruct 的三步流程:导出 OpenVINO IR、量化、推理。
OpenAI 与 Broadcom 宣布多年期战略合作,将部署 10 吉瓦 OpenAI 设计的 AI 加速器。双方将共同开发下一代系统与以太网方案,目标是在 2029 年前支撑可扩展、高能效的 AI 基础设施。
推荐理由:OpenAI 与 Broadcom 的多年合作给出了 10 吉瓦自研加速器的部署规模与 2029 年时间点,可据此观察其算力自研路线。
Arm 将于 10 月 22-23 日参展 PyTorch Conference,展示如何用 PyTorch 和 ExecuTorch 构建与部署 AI 应用。
AMD 与 OpenAI 宣布达成多年期合作,将部署 6 吉瓦 AMD Instinct GPU,用于支撑 OpenAI 的下一代 AI 基础设施。部署从 2026 年的 1 吉瓦起步。
推荐理由:OpenAI 与 AMD 的多年期算力合作给出了分阶段部署规模,可观察其基础设施供应格局的变化。
Hugging Face 发布三部分系列文章,讲述如何将 RedNote 的 3B 参数 OCR 模型 dots.ocr 转换到端侧运行,该模型在 OmniDocBench 上超过 Gemini 2.5 Pro。
Hugging Face 用 OpenVINO.GenAI 在 Intel Core Ultra 上加速 Qwen3-8B 智能体,以 Qwen3-0.6B 作草稿模型做投机解码,生成速度提升约 1.3 倍。
OpenAI、Oracle 和 SoftBank 宣布为 Stargate 新增五个 AI 数据中心站点,推进一项 500B 美元、10 吉瓦的美国基础设施扩建,用于支撑下一代 AI 并创造数万个就业岗位。
推荐理由:OpenAI、Oracle 与 SoftBank 公布 Stargate 五个新站点,读者可了解这笔 5000 亿美元、10 吉瓦级美国算力基建的推进节奏。
OpenAI 与 NVIDIA 宣布战略合作,将部署 10 吉瓦由 NVIDIA 系统驱动的 AI 数据中心,首期于 2026 年启动。
推荐理由:OpenAI 与 NVIDIA 的 10 吉瓦算力合作给出了首期落地时间,可据此观察大模型训练算力的供给节奏。
Hugging Face Hub 现已支持 Scaleway 作为推理服务商,用户可直接在模型页调用 gpt-oss、Qwen3、DeepSeek R1、Gemma 3 等开放权重模型。