用一条命令在 HF Jobs 上运行 vLLM 服务器
Hugging Face 发布教程,介绍用一条 hf jobs run 命令在 HF Jobs 上启动私有、OpenAI 兼容的 vLLM 端点,按秒计费,无需自建服务器或 Kubernetes。
推荐理由:原文给出从启动到查询、SSH 调试和接入编码智能体的完整命令,读者可据此自建 OpenAI 兼容端点。
把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。
Hugging Face 发布教程,介绍用一条 hf jobs run 命令在 HF Jobs 上启动私有、OpenAI 兼容的 vLLM 端点,按秒计费,无需自建服务器或 Kubernetes。
推荐理由:原文给出从启动到查询、SSH 调试和接入编码智能体的完整命令,读者可据此自建 OpenAI 兼容端点。
Mistral 发布 OCR 4,在提取文本之外新增边界框、块类型分类和逐页逐词置信度分数,支持 170 种语言,可单容器自托管部署。该模型在 OlmOCRBench 上取得 85.20 分,OmniDocBench 上为 93.07 分,官方称独立标注者在 600 多份文档的盲评中平均偏好率约 72%。
推荐理由:OCR 4 把文档解析从纯文本扩展到带边界框和块分类的结构化输出,读者可据此判断它是否适合接入现有 RAG 或智能体流程。
Hugging Face 把 huggingface_hub 的发布周期从每 4 到 6 周一次改为每周一次,整套流程跑在单个 GitHub Actions workflow 上,由 OpenCode 驱动开源权重模型(当前为 Z.ai 的 GLM-5.2)起草 release notes 和 Slack 公告。
推荐理由:原文公开了每周发版的完整工作流与 trust-but-verify 校验循环,可迁移到其他 Python 库的发布流程。
PaddleOCR 发布新一代通用 OCR 模型家族 PP-OCRv6,已在 Hugging Face 上线,提供 tiny、small、medium 三档,参数量从 1.5M 到 34.5M,其中 small 和 medium 支持 50 种语言。
推荐理由:原文给出三档模型参数、检测与识别指标及多后端接入方式,便于按部署场景选型。
Hugging Face 博客分享用本地模型在智能体框架中对 OpenClaw 仓库的 Issue 和 PR 做分类分诊,实现近乎实时的通知且无需云端模型配额。
推荐理由:原文给出本地模型做 PR/Issue 分类的完整架构与 330 行评测数据,可迁移到其他高吞吐分诊场景。
H Company 发布 Holo3.1 系列 Computer Use Agent 模型,基于 Qwen 家族,覆盖 0.8B、4B、9B 和 35B-A3B 四种尺寸,并首次提供 FP8、Q4 GGUF 和 NVFP4 量化权重。
推荐理由:原文给出跨环境、跨框架与本地量化部署的具体数据,可据此判断端侧 Computer Use Agent 的落地条件。
JetBrains 发布 Mellum2,一个从零训练、覆盖自然语言与代码的 12B 参数 MoE 模型,每个 token 仅激活 2.5B 参数,以 Apache 2.0 许可开源。官方称其在相近规模模型中基准表现有竞争力,推理速度超过 2 倍,可用于路由、RAG、摘要、子智能体和高吞吐编码场景。模型已在 Hugging Face 提供下载,技术报告发布在 arXiv(2605.31268)。
推荐理由:JetBrains 开源 12B MoE 模型,每 token 仅激活 2.5B 参数,读者可据此判断它在多模型系统中的定位。
Mistral 在 AI Now Summit 2026 上发布面向工业工程的集成 AI 栈,结合物理模型、工程经验与机器人技术,合作方包括 Airbus、BMW 和 ASML,用于加速设计、消除仿真瓶颈并优化资产性能。
推荐理由:Mistral 把工业工程 AI 栈、Vibe 智能体和自建推理数据中心放在一起发布,可看其企业级全栈布局。
Hugging Face 在 TRL 中落地了增量权重同步(Delta Weight Sync):只把两次 RL 优化步之间真正变化的 bf16 权重编码成稀疏 safetensors 文件,上传到 Hugging Face Bucket,再由 vLLM 拉取应用。
推荐理由:TRL 的稀疏增量权重同步把异步 RL 每步传输量压到原来的百分之几,读者可据此判断跨集群训练的成本边界。
OpenAI 的 GPT 模型、Codex 和 Managed Agents 现已在 AWS 上可用,企业可在自己的 AWS 环境中构建安全的 AI。原文未披露具体模型版本、上线区域或计费方式。
推荐理由:OpenAI 把 GPT 模型、Codex 和 Managed Agents 放进 AWS 环境,读者可了解企业侧部署路径的变化。
Mistral AI 发布企业 AI 编排层 Workflows 公开预览版,提供持久化执行、可观测性和容错能力,ASML、ABANCA、CMA-CGM、France Travail、La Banque Postale、Moeve 等客户已用它自动化关键流程。
推荐理由:原文给出 Workflows 的编排能力、部署模型与已落地客户案例,读者可据此判断企业级 AI 流程如何从概念验证走向生产。
Google DeepMind 发布论文提出 Decoupled DiLoCo 分布式训练架构,将训练拆分为解耦的计算“岛屿”,岛屿间异步传输数据,从而隔离局部硬件故障。
推荐理由:原文给出分布式训练新架构的带宽、容错与跨代硬件实测数据,可据此判断大规模预训练基础设施的演进方向。
OpenAI 更新 Agents SDK,新增原生沙箱执行和模型原生 harness,帮助开发者在文件与工具之间构建安全、长时间运行的智能体。
推荐理由:官方披露 Agents SDK 新增原生沙箱执行与模型原生 harness,读者可据此判断长时智能体的构建方式变化。
Mistral AI 推出 Forge,一个让企业基于专有知识构建前沿级 AI 模型的系统,支持预训练、后训练和强化学习等阶段。Forge 支持 dense 与 MoE 两种架构,并可按需支持多模态输入,模型可在企业自有基础设施内训练和治理。
推荐理由:原文给出了企业用自有数据训练前沿模型的分阶段能力与多架构支持,读者可据此判断自建模型的落地路径。
H Company 发布 Holotron-12B,一个基于 NVIDIA Nemotron-Nano-2 VL 后训练的多模态计算机操作模型,已在 Hugging Face 上线,采用 NVIDIA Open Model License。
推荐理由:原文给出混合 SSM 架构带来的吞吐对比数据与 WebVoyager 提升幅度,可据此判断计算机操作智能体的部署成本。
OpenAI 介绍如何用 Responses API、shell 工具和托管容器构建智能体运行时,让智能体在文件、工具和状态支持下安全、可扩展地运行。
推荐理由:OpenAI 官方披露 Responses API 的智能体运行时构成,读者可了解其如何用 shell 工具与托管容器支撑有状态智能体。
Hugging Face 在 Hub 上推出 Storage Buckets,一种非版本化的 S3 式可变对象存储,用于存放 checkpoint、优化器状态、处理后的分片和 Agent traces 等中间产物。
推荐理由:原文给出 Buckets 的创建、同步与 Python 调用方式,读者可据此判断它能否替代现有中间产物存储流程。
Hugging Face 博客介绍 Gradio 6 中 gr.HTML 的新能力,支持自定义模板、作用域 CSS 和 JavaScript 交互,可在单个 Python 文件中完成前端、后端与状态管理,无需构建步骤即可部署到 Hugging Face Spaces。
推荐理由:原文给出 gr.HTML 的模板、状态同步与子类化写法,读者可据此把自定义组件直接接入现有 Gradio 流程。
Hugging Face 发布 cuda-kernels Agent Skill,让 Claude、Codex 等编码智能体为 diffusers 和 transformers 项目编写生产级 CUDA 内核,并生成 PyTorch 绑定与基准脚本。
推荐理由:原文给出可安装的 CUDA 内核技能与完整基准数据,读者可据此判断智能体写内核的可行边界。
Hugging Face 发布 Transformers.js v4,已上线 NPM,可通过 npm i @huggingface/transformers 安装。
推荐理由:官方披露了 WebGPU 运行时重写、构建提速与包体积变化,可据此判断浏览器端本地推理的工程成熟度。