Baseten 加入 Hugging Face Inference Providers
Baseten 成为 Hugging Face Hub 支持的 Inference Provider,首批上线对话与文本生成任务,可调用 Kimi K3、DeepSeek V4 Flash、GLM-5.2 等开放权重模型。
Baseten 成为 Hugging Face Hub 支持的 Inference Provider,首批上线对话与文本生成任务,可调用 Kimi K3、DeepSeek V4 Flash、GLM-5.2 等开放权重模型。
微软研究院发布开源框架 Orchard,核心是 Kubernetes 环境服务 Orchard Env,可跨任务域复用环境、数据管线和评测流程,并支持直接在 Codex、OpenClaw、ZeroClaw 等真实 harness 中训练智能体。
推荐理由:Orchard 把环境层做成可复用服务,并公开训练数据与评测方法,读者可据此判断开放智能体训练的成本门槛变化。
Circles 借助 OpenAI API 与 Codex 打造 AI 原生电信体验,实现 ARPU 提升 22%、用户流失率下降 9%,并提高开发效率。
Hugging Face 博客指出,AI 的下一个真正约束不是智能而是 GPU 利用率:GPU 成本按日历小时累积,产出却只按计算小时计,因此两家 GPU 预算相当的公司会因利用率差异而拉开经济性差距。
OpenAI 宣布下调 GPT-5.6 在 Luna 和 Terra 上的价格,并介绍其更高效的模型如何帮助企业规模化部署 AI 工作流。
推荐理由:OpenAI 下调 GPT-5.6 在 Luna 与 Terra 上的价格,读者可据此重新估算企业级 AI 工作流的部署成本。
Berkeley Sky Lab 与 IBM Research 将演化式 kernel 搜索框架 K-Search 扩展到 MLX 后端,通过结构化 CUDA-to-MLX 翻译层把已有 CUDA kernel 知识迁移到 Apple Silicon。
Diffusers 现已原生支持 Nunchaku 的 SVDQuant 4-bit 量化推理,加载 Nunchaku checkpoint 只需调用 from_pretrained(),无需本地编译 CUDA,内核通过 kernels 包从 Hub 下载。
推荐理由:原文给出 Nunchaku Lite 在 Diffusers 中的加载方式、显存与延迟数据,读者可据此判断消费级 GPU 跑扩散模型的实际收益。
OpenAI 宣布在佐治亚州 Effingham County 启动 Project Camellia,承诺负责任的能源使用、社区投资与就业机会,并提供 Codex 的使用权限。
NTT DATA Group 借助 ChatGPT Enterprise 和 Codex,帮助 9,000 名员工实现工作自动化,并将事件分析时间缩短至 30 分钟。该集团同时借此推进安全可控的 AI 规模化落地。
在 AppWorld Test Challenge 的 417 个任务上,同一 CodeAct 智能体下 Claude Sonnet 4.6 总成本 79 美元(0.19 美元/任务),GPT-4.1 却要 155 美元(0.37 美元/任务),尽管后者 token 单价更低——缓存命中率才是关键。
Hugging Face 博客发布 "Profiling in PyTorch" 系列第三篇,用 NVIDIA A100-SXM4-80GB 剖析 attention 的 profiler 轨迹。
Hugging Face 宣布 vLLM 的 transformers 建模后端现已达到甚至超过 vLLM 手写原生实现的吞吐速度,模型作者无需移植即可获得快速推理。
推荐理由:原文给出 transformers 后端在 vLLM 中追平原生实现的具体基准与启用方式,读者可据此判断是否省去自定义移植。
Hugging Face 与 Amazon SageMaker AI 推出深度链接集成,开发者在支持的模型页面点击 Customize 或 Deploy 即可直达 SageMaker Studio,模型预加载、环境自动配置。
Google Research 在 10 座美国城市开展大规模实验,通过修改 Google Maps 算法将不到 2% 的行程引导至拥堵路段之外的替代路线,使目标路段行驶速度中位数提升约 2%,燃油消耗率中位数下降 0.5% 至 1.0%。
微软在 Build 2026 宣布 Foundry Managed Compute 及 Hugging Face 模型集合,将 Hugging Face 生态的开源权重模型引入 Foundry 模型目录,每周刷新并可一键部署到托管 GPU 平台。
伯克利 EPIC Data Lab 提出,随着推理成本从 2023 年初 GPT-4 级约 $30/百万 token 降至如今不足 $1、部分厂商低于 $0.10,数据系统需应对三大新挑战:为智能体设计的数据系统、运行智能体集群的数据系统、以及由智能体合成的数据系统。在 text-to-SQL 基准上,多智能体尝试同一任务时仅 10-20% 子计划不同,80-90% 子查询存在重复计算。
Hugging Face 与 SkyPilot 联合推出集成,用户可用一个 hf:// URL 和现有 HF_TOKEN 把 Hugging Face Bucket 或任意模型、数据集、Space 仓库挂载进 SkyPilot 任务,并在 20+ 云、Kubernetes、Slurm 和本地集群上运行。
推荐理由:原文给出 hf:// 挂载方式、免出网费与 Xet 去重的具体机制,读者可据此判断跨云训练存储成本的变化。
Import AI 464 汇总多项 AI 研究进展。Fable 在 KernelBench-Mega 上写出被维护者称为首个真正且最快的 megakernel。
Hugging Face 为 Kernels 项目引入 Hub 上的 "kernel" 新仓库类型,并默认只加载受信任发布者的内核,其他来源需显式传入 trust_remote_code=True。
OpenAI 工程师通过大规模 core dump 分析排查基础设施的罕见崩溃,同时发现了一处硬件故障和一个存在 18 年之久的软件 bug。
Hugging Face 发布教程,介绍用一条 hf jobs run 命令在 HF Jobs 上启动私有、OpenAI 兼容的 vLLM 端点,按秒计费,无需自建服务器或 Kubernetes。
推荐理由:原文给出从启动到查询、SSH 调试和接入编码智能体的完整命令,读者可据此自建 OpenAI 兼容端点。
Google Research 提出线性弹性缓存,将页面淘汰建模为滑雪租赁问题,用轻量机器学习动态调整缓存大小,在 Spanner 生产环境实测内存用量降低 15.5%、缓存未命中仅增加 5.5%、TCO 降低约 5%。该方案用浅层决策树为每个页面预测 TTL,缓存写满时仍由 LRU 兜底,并在多个公开缓存 trace 上与 GDSF 基线对比验证。
NVIDIA 在 Hugging Face 博客发布开源库 NeMo AutoModel,基于 Transformers v5 构建,新增 Expert Parallelism。
Mistral 为 Connectors 推出多项新能力:管理员控制、带 connector 作用域的 API key、多账号 connector 与 Connectors Debugger 均已 GA 或进入 Public Preview。
OpenAI 与 Broadcom 联合推出 Jalapeño,一款专为 LLM 推理打造的定制 AI 芯片。该芯片旨在提升 AI 系统在性能、能效与规模化方面的表现。
Mistral 发布 OCR 4,在提取文本之外新增边界框、块类型分类和逐页逐词置信度分数,支持 170 种语言,可单容器自托管部署。该模型在 OlmOCRBench 上取得 85.20 分,OmniDocBench 上为 93.07 分,官方称独立标注者在 600 多份文档的盲评中平均偏好率约 72%。
推荐理由:OCR 4 把文档解析从纯文本扩展到带边界框和块分类的结构化输出,读者可据此判断它是否适合接入现有 RAG 或智能体流程。
Hugging Face 把 huggingface_hub 的发布周期从每 4 到 6 周一次改为每周一次,整套流程跑在单个 GitHub Actions workflow 上,由 OpenCode 驱动开源权重模型(当前为 Z.ai 的 GLM-5.2)起草 release notes 和 Slack 公告。
推荐理由:原文公开了每周发版的完整工作流与 trust-but-verify 校验循环,可迁移到其他 Python 库的发布流程。
Google Chrome 团队与 Hugging Face 合作,在 Transformers.js 中试验跨源存储(Cross-Origin Storage)API,用加密哈希而非 URL 标识文件,让不同源的应用共享同一份模型与 Wasm 资源。
PaddleOCR 发布新一代通用 OCR 模型家族 PP-OCRv6,已在 Hugging Face 上线,提供 tiny、small、medium 三档,参数量从 1.5M 到 34.5M,其中 small 和 medium 支持 50 种语言。
推荐理由:原文给出三档模型参数、检测与识别指标及多后端接入方式,便于按部署场景选型。
Hugging Face 博客分享用本地模型在智能体框架中对 OpenClaw 仓库的 Issue 和 PR 做分类分诊,实现近乎实时的通知且无需云端模型配额。
推荐理由:原文给出本地模型做 PR/Issue 分类的完整架构与 330 行评测数据,可迁移到其他高吞吐分诊场景。
Samsung Electronics 在全球员工中部署 ChatGPT Enterprise 和 Codex,成为 OpenAI 规模最大的企业 AI 落地项目之一。
OpenAI 推出 Partner Network,投入 1.5 亿美元帮助全球合作伙伴加速企业 AI 的采用、部署与转型。
UC San Diego 在 Google 支持下正建设一个由 2000 台退役 Pixel 手机组成的计算集群,取出主板后以 Kubernetes 编排成 25-50 台一组、运行通用 Linux 的集群,为数百名师生提供低成本低碳云计算。
PyTorch 性能剖析系列第二部分用 nn.Linear(bias=True)替换手写 matmul-add,并堆叠三层加激活组成 MLP,在 NVIDIA A100-SXM4-80GB 上分析 profiler trace。
OpenAI 模型与 Codex 现可通过 Oracle Cloud 访问,企业可使用已有的云承诺额度来构建和部署 AI。该方式支持企业级安全与治理。
Hugging Face 发布 jobs-actions 桥接方案,让 GitHub Actions 把 CI 任务调度到 Hugging Face Jobs 上运行,Trackio 借此将 CPU 任务 CI 时间缩短约 30%,并新增了在 GPU 机器上运行的测试套件。
H Company 发布 Holo3.1 系列 Computer Use Agent 模型,基于 Qwen 家族,覆盖 0.8B、4B、9B 和 35B-A3B 四种尺寸,并首次提供 FP8、Q4 GGUF 和 NVFP4 量化权重。
推荐理由:原文给出跨环境、跨框架与本地量化部署的具体数据,可据此判断端侧 Computer Use Agent 的落地条件。
JetBrains 发布 Mellum2,一个从零训练、覆盖自然语言与代码的 12B 参数 MoE 模型,每个 token 仅激活 2.5B 参数,以 Apache 2.0 许可开源。官方称其在相近规模模型中基准表现有竞争力,推理速度超过 2 倍,可用于路由、RAG、摘要、子智能体和高吞吐编码场景。模型已在 Hugging Face 提供下载,技术报告发布在 arXiv(2605.31268)。
推荐理由:JetBrains 开源 12B MoE 模型,每 token 仅激活 2.5B 参数,读者可据此判断它在多模型系统中的定位。
Hugging Face 博客提出,企业 AI 规模化落地的关键不在 LLM 本身,而在"Agent 逻辑"——即知识图谱、算法、程序分析库等运行于智能体层的软件原语,可引导 LLM 聚焦企业工作流、压缩上下文空间。