OpenAI 在密歇根动工 1GW 数据中心,纳入 Stargate 项目
OpenAI 在密歇根破土动工一个 1GW 数据中心项目,属于 Stargate 计划的一部分。该项目建设 AI 基础设施,目标是扩大使用范围、创造就业并支持当地社区。
OpenAI 在密歇根破土动工一个 1GW 数据中心项目,属于 Stargate 计划的一部分。该项目建设 AI 基础设施,目标是扩大使用范围、创造就业并支持当地社区。
OpenAI 前沿模型与 Codex 现已在 AWS 上正式可用,企业可通过现有的 AWS 环境、管控和采购流程接入 OpenAI。客户可在 AWS 上开始使用 OpenAI,更快从评估走向生产部署。
Hugging Face 发布 PyTorch 性能分析系列第一篇,讲解如何用 torch.profiler 分析矩阵乘法加法运算。教程基于 PyTorch 2.13 和 NVIDIA A100-SXM4-80GB,介绍 profiler 表格与 trace 两种产物的用法,并演示 torch.compile 对执行链路的影响。
Mistral 在 AI Now Summit 2026 上发布面向工业工程的集成 AI 栈,结合物理模型、工程经验与机器人技术,合作方包括 Airbus、BMW 和 ASML,用于加速设计、消除仿真瓶颈并优化资产性能。
推荐理由:Mistral 把工业工程 AI 栈、Vibe 智能体和自建推理数据中心放在一起发布,可看其企业级全栈布局。
Hugging Face 在 TRL 中落地了增量权重同步(Delta Weight Sync):只把两次 RL 优化步之间真正变化的 bf16 权重编码成稀疏 safetensors 文件,上传到 Hugging Face Bucket,再由 vLLM 拉取应用。
推荐理由:TRL 的稀疏增量权重同步把异步 RL 每步传输量压到原来的百分之几,读者可据此判断跨集群训练的成本边界。
OpenAI 与 Dell 达成合作,将 Codex 引入混合云和本地部署环境,让企业能在自有数据与工作流中安全部署 AI 编程智能体。
Hugging Face 详解如何在连续批处理中引入异步化,把 CPU 批次准备与 GPU 批次计算解耦并行执行。同步批处理下 CPU 与 GPU 轮流工作,用 8B 模型、batch size 32 生成 8K tokens 耗时 300.6 秒,其中 24.0% 时间 GPU 处于空闲等待 CPU。
OpenAI 为在 Windows 上启用 Codex 构建了一个安全有效的沙箱,通过受控的文件访问和网络限制来隔离其运行。该方案旨在让 Codex 在 Windows 环境下安全执行任务。
Hugging Face 博客发布系列文章,分析 AWS 基础设施如何与开源软件栈配合支撑基础模型全生命周期。文章指出 scaling 已从单一预训练曲线演变为预训练、后训练与测试时计算三条路径,并梳理了 Slurm、Kubernetes、PyTorch、JAX、Prometheus、Grafana 等 OSS 工具的分层架构。
OpenAI 发文阐述企业如何将 AI 从早期实验推进到持续复利的影响,关键在于信任、治理、工作流设计与规模化质量四个方面。
OpenAI 推出企业部署公司 DeployCo,目标是帮助各类组织把前沿 AI 投入生产环境,并转化为可衡量的业务成果。
OpenAI 通过沙箱隔离、审批机制、网络策略和智能体原生遥测来安全运行 Codex,以支持安全合规地采用编码智能体。
PipelineRL 在 vLLM V0 到 V1 迁移中通过四项修复让 V1 与 V0 参考轨迹对齐:启用 processed_logprobs、显式关闭 prefix caching 与 async scheduling、匹配 inflight 权重更新路径,以及最终投影使用 fp32 lm_head。
OpenAI 推出 MRC(Multipath Reliable Connection)超级计算机网络协议,通过 OCP 开放发布,用于提升大规模 AI 训练集群的韧性与性能。
OpenAI 重建了其 WebRTC 技术栈,以支撑实时语音 AI 的低延迟、全球规模与流畅的对话轮次切换。
OpenAI 正扩建 Stargate,为支撑 AGI 构建算力基础设施,并新增数据中心容量以应对不断增长的 AI 需求。
DeepInfra 现已作为 Inference Provider 接入 Hugging Face Hub,首批支持对话与文本生成任务,可调用 DeepSeek V4、Kimi-K2.6、GLM-5.1 等开放权重 LLM,后续将扩展至文生图、文生视频和嵌入向量等任务。
OpenAI 的 GPT 模型、Codex 和 Managed Agents 现已在 AWS 上可用,企业可在自己的 AWS 环境中构建安全的 AI。原文未披露具体模型版本、上线区域或计费方式。
推荐理由:OpenAI 把 GPT 模型、Codex 和 Managed Agents 放进 AWS 环境,读者可了解企业侧部署路径的变化。
Mistral AI 发布企业 AI 编排层 Workflows 公开预览版,提供持久化执行、可观测性和容错能力,ASML、ABANCA、CMA-CGM、France Travail、La Banque Postale、Moeve 等客户已用它自动化关键流程。
推荐理由:原文给出 Workflows 的编排能力、部署模型与已落地客户案例,读者可据此判断企业级 AI 流程如何从概念验证走向生产。
OpenAI 本周在 Hugging Face Hub 开源 Privacy Filter,一个 1.5B 参数、50M 激活参数的 PII 检测模型,Apache 2.0 许可,单次前向即可在 128k 上下文内标注八类个人信息,并在 PII-Masking-300k 基准上达到 SOTA。
Hugging Face 发布 Transformers.js 浏览器扩展教程,演示如何在 Manifest V3 约束下用 Gemma 4 E2B 构建本地 AI 功能。
Google DeepMind 发布论文提出 Decoupled DiLoCo 分布式训练架构,将训练拆分为解耦的计算“岛屿”,岛屿间异步传输数据,从而隔离局部硬件故障。
推荐理由:原文给出分布式训练新架构的带宽、容错与跨代硬件实测数据,可据此判断大规模预训练基础设施的演进方向。
OpenAI 详解 Codex 智能体循环,通过 WebSockets 与连接级缓存降低 API 开销并改善模型延迟。该方案针对 Responses API 的智能体工作流,减少重复请求带来的额外负担。
OpenAI 更新 Agents SDK,新增原生沙箱执行和模型原生 harness,帮助开发者在文件与工具之间构建安全、长时间运行的智能体。
推荐理由:官方披露 Agents SDK 新增原生沙箱执行与模型原生 harness,读者可据此判断长时智能体的构建方式变化。
Cloudflare 将 OpenAI 的 GPT-5.4 和 Codex 引入 Agent Cloud,让企业能够构建、部署并规模化运行面向真实任务的 AI 智能体。该集成强调速度与安全性,面向企业级智能体工作流场景。
OpenAI 发布面向金融服务的 AI 资源集合,包含提示词包、GPTs、指南和工具,帮助机构安全部署并规模化应用 AI。
Mistral AI 发布 Spaces CLI,用于脚手架搭建项目、启动开发环境、生成配置并部署到 staging,典型流程只需 `spaces init`、`cd`、`spaces dev` 三条命令即可获得带热重载、数据库和 Dockerfile 的多服务项目。
Mistral AI 推出 Forge,一个让企业基于专有知识构建前沿级 AI 模型的系统,支持预训练、后训练和强化学习等阶段。Forge 支持 dense 与 MoE 两种架构,并可按需支持多模态输入,模型可在企业自有基础设施内训练和治理。
推荐理由:原文给出了企业用自有数据训练前沿模型的分阶段能力与多架构支持,读者可据此判断自建模型的落地路径。
H Company 发布 Holotron-12B,一个基于 NVIDIA Nemotron-Nano-2 VL 后训练的多模态计算机操作模型,已在 Hugging Face 上线,采用 NVIDIA Open Model License。
推荐理由:原文给出混合 SSM 架构带来的吞吐对比数据与 WebVoyager 提升幅度,可据此判断计算机操作智能体的部署成本。
OpenAI 介绍如何用 Responses API、shell 工具和托管容器构建智能体运行时,让智能体在文件、工具和状态支持下安全、可扩展地运行。
推荐理由:OpenAI 官方披露 Responses API 的智能体运行时构成,读者可了解其如何用 shell 工具与托管容器支撑有状态智能体。
Wayfair 采用 OpenAI 模型自动化客服工单分流,并大规模优化数百万条商品属性,以提升电商支持效率与商品目录准确率。
Hugging Face 对 16 个围绕异步训练构建的开源 RL 库做了横评,按编排原语、rollout buffer 设计、权重同步协议、陈旧度管理、部分 rollout 处理、LoRA 支持与分布式训练后端 7 个维度对比。
Hugging Face 在 Hub 上推出 Storage Buckets,一种非版本化的 S3 式可变对象存储,用于存放 checkpoint、优化器状态、处理后的分片和 Agent traces 等中间产物。
推荐理由:原文给出 Buckets 的创建、同步与 Python 调用方式,读者可据此判断它能否替代现有中间产物存储流程。
Hugging Face 博客详解源自 Snowflake AI Research 的 Ulysses 序列并行(ALST 协议的一部分),通过注意力头并行与 all-to-all 通信把长序列切分到多 GPU,突破单卡显存限制。
Hugging Face 博客发布 NXP 的实践指南,介绍如何在嵌入式机器人平台上部署 VLA 模型,涵盖数据集录制、ACT 与 SmolVLA 策略微调以及端侧优化。文中以“把茶包放进杯子”任务为例,录制 120 个 episode,将工作空间划分为 11 个 10×10 cm 起始位置簇,并建议约 20% 训练集为恢复 episode。NXP i.MX 95 SoC 在优化后实现了实时性能。
Hugging Face 发文介绍 transformers 库如何为 MoE 模型重构支持,涵盖权重加载、专家后端、专家并行与训练四部分。权重加载引入 WeightConverter 与惰性物化,将 256 个独立专家张量打包为单个连续张量;在 Qwen1.5-110B-Chat 上,v5 异步加载耗时 20.71s,v4 为 66.24s,张量并行下为 10.1s。
OpenAI 宣布推出 Frontier Alliance Partners,帮助企业从 AI 试点走向生产环境,实现安全、可扩展的智能体部署。
Hugging Face 博客介绍 Gradio 6 中 gr.HTML 的新能力,支持自定义模板、作用域 CSS 和 JavaScript 交互,可在单个 Python 文件中完成前端、后端与状态管理,无需构建步骤即可部署到 Hugging Face Spaces。
推荐理由:原文给出 gr.HTML 的模板、状态同步与子类化写法,读者可据此把自定义组件直接接入现有 Gradio 流程。
OpenAI 构建了一套实时访问系统,将速率限制、用量追踪与 credits 结合,为 Codex 和 Sora 提供持续访问能力。该系统旨在突破单纯速率限制的局限,支撑这两个产品的规模化访问。
Hugging Face 发布 cuda-kernels Agent Skill,让 Claude、Codex 等编码智能体为 diffusers 和 transformers 项目编写生产级 CUDA 内核,并生成 PyTorch 绑定与基准脚本。
推荐理由:原文给出可安装的 CUDA 内核技能与完整基准数据,读者可据此判断智能体写内核的可行边界。