OpenAI 如何将 Habitat 扩展为支撑 10 亿 ChatGPT 用户的在线存储平台
OpenAI 将内部存储系统 Habitat 从 Python 库演进为全球分布式存储平台,支撑超 10 亿 ChatGPT 用户、每秒 2200 万次请求。该平台用于应对 ChatGPT 规模增长带来的在线存储需求。
OpenAI 将内部存储系统 Habitat 从 Python 库演进为全球分布式存储平台,支撑超 10 亿 ChatGPT 用户、每秒 2200 万次请求。该平台用于应对 ChatGPT 规模增长带来的在线存储需求。
Mistral 与 Cloudera 达成合作,将 Mistral 模型集成进 Cloudera 混合数据平台,企业可在私有云、公有云、本地及完全气隙环境中部署推理并保持控制权。企业还能在受控环境中用专有数据训练自有模型,基于开放权重拥有数据和由此产生的智能。Cloudera 平台上客户管理的数据规模达 30 exabytes。
TRL v1.14 的 AsyncGRPOTrainer 现已支持只训练并同步 LoRA adapter 到 vLLM,rank-1 adapter 仅几 MB,可通过挂载在三个 HF Jobs 上的 Storage Bucket 传输,无需 NCCL。
商汤(SenseTime)以“Models + Token Factory + Agent Harness”策略推进 AI 商业化,不再盲目追求模型规模,转而帮客户完成真实任务。
Mistral 帮助一家欧洲能源运营商将 4 万行 Fortran 77 迁移至 C++,对象是一个无测试套件、无集中文档的物理密集型油藏模拟器。团队先构建数值一致性校验框架,再用 Vibe CLI 调度上百个智能体解析调用树并生成文档,最终采用人工介入的 coder、tester、reviewer 智能体工作流逐模块迁移。
GitHub 发布 Project HydraFusion 研究预览,在运行时通过多模型编排完成任务,已面向所有 GitHub Copilot 套餐开放,可在 GitHub Copilot CLI 中通过 /experimental 启用。
推荐理由:GitHub 官方披露 HydraFusion 的三种编排模式与三套基准的成本质量对比,可据此判断多模型编排在编码任务上的取舍。
OpenAI 宣布医疗机构可将 EHR 及更多行业数据接入 ChatGPT,让临床医生安全获取患者背景信息与医学研究资料。ChatGPT 由此可连接可信医疗数据,用于临床场景中的信息调取。
澳大利亚律所 Gilbert + Tobin 借助 CEO 主导的投入、严格治理与人工问责机制,在全所范围规模化部署 ChatGPT Enterprise 和 Codex。该案例展示了律所如何在扩展 AI 应用的同时保持人类对结果的负责。
郭明錤指出MediaTek最新公告反复使用rack-scale一词,验证了他两个多月前研究的核心结论:MediaTek已将AI业务战略定位从IC / ASIC设计升级为系统级设计。
Hugging Face 发布 @huggingface/kernels,一个从 Hugging Face Hub 加载并运行优化 WebGPU kernel 的 JavaScript 库,同时上线 207 个 kernel 的初始集合,均以 Apache-2.0 许可发布在 webgpu-kernels 组织下。
推荐理由:原文给出 207 个 WebGPU kernel 的发布结构、加载方式与对比数据,可据此判断浏览器端推理的优化路径。
郭明錤表示,行业调研显示 Nvidia 已恢复此前被认为被砍掉的 Rubin CPX 项目,预计 1Q27 量产,且 prefill 性能较旧设计更强。
郭明錤称其最新产业调查显示,Nvidia 已重启此前被认为被移出产品蓝图的 Rubin CPX,预计于 1Q27 开始生产,重启版 prefill 效能更强,GPU 规格与机柜架构均有明显改变。
推荐理由:原文给出了完整的命令行参数与显存占用数据,读者可据此复现消费级显卡跑大模型的配置。
一个高性能 125B 模型现在仅用 75GB RAM 即可本地运行!感谢 @UnslothAI 的 day-0 支持。🥳
IBM Granite 团队发布 Granite 4.2,这是其首个稠密 decoder-only 推理模型家族,包含 3B、8B、30B 三个规模,全部以 Apache 2.0 许可开源。
OpenAI 公布自研推理芯片 Jalapeño 的首批结果,称其在 AI 推理上实现业界领先的速度与能效。该定制芯片面向现代模型提供更高吞吐量和更低延迟,同时更省电。
OpenAI 为 ChatGPT Work 和 Codex 推出 Admin 插件,用于分析工作区用量、管理成员与权限、调整限额并处理管理请求。
Mistral 与 HUMAIN 宣布战略合作,覆盖 AI 基础设施、先进模型开发与 AI 解决方案部署,初期聚焦网络安全和语音,并计划开发阿拉伯语表现强劲的前沿模型,合作规模达数亿欧元。Mistral 将探索使用 HUMAIN 数据中心基础设施,双方还计划在沙特面向受监管行业制定联合市场策略,以满足对主权 AI 的需求。
Papers with Code 的混合搜索系统用 Hugging Face Jobs 做全量论文嵌入、Storage Buckets 做持久化中转、Inference Endpoints 提供在线查询的低延迟嵌入,目前维护超过 11 万篇来自 arXiv 和 Daily Papers 的论文嵌入。
Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 草稿模型检查点,通过投机解码在 GPU 上最高提升 3.18 倍吞吐、端侧最高 2.87 倍,且不改变输出质量。
推荐理由:Liquid AI 给出三款 LFM2.5 草稿模型的实测吞吐与函数调用延迟数据,可据此判断端侧推理的可用性。
Hugging Face 构建了约束感知的 GPU 分配器,在相同硬件和负载下对比 FIFO 调度器,七个基准场景中 GPU 利用率最高提升 33 个百分点,优先级加权产出最高提升 105%。在五个真实争用场景中,利用率从 52–85% 提升至 72–88%,优先级加权价值平均提升 52%。核心变化不在硬件,而在于分配决策的顺序:实时推理按需求曲线逐时间步分配,批式任务按优先级跨整个调度周期排布。
微软很荣幸成为 SIGCOMM 2026 的一部分。查看我们的会议内容,涵盖网络流量工程、新的负载均衡策略、自适应光子交换调度、AI 网络模拟等。msft.it/6018aKgfp
AWS 开源 SDK Strands Robots(Apache 2.0)演示了机器人数据闭环:用 Robot("so100") 录制 LeRobotDataset 并同步到 Hugging Face Storage Buckets。
OpenAI 预览新的 API 服务层级 Ultrafast,运行 GPT-5.6 Sol 时最高可提速 14 倍。该服务由 Cerebras 提供支持,输出速度最高可达每秒 750 个 token。
RingCentral 借助 ChatGPT Work 和 Codex 加速 AI 产品开发,并在工程与运营之间集中化运营智能。该实践覆盖从工程到运营的 AI 原生工作流程。
Mistral 宣布三项推进 AI 主权的举措:Mistral Regional Endpoints 正式可用,客户可选择推理在欧洲或美国运行;Mistral Priority Tier 进入公开预览,为关键业务负载提供承诺服务等级、自定义速率限制和 uptime SLA。
推荐理由:Mistral 把区域推理端点、优先级服务层与第三方开源模型接入放在同一套基础设施上,读者可据此判断主权 AI 的落地路径。
OpenAI 与 AWS 合作,通过 Amazon Bedrock 提供 Daybreak 网络安全能力,以支持企业安全相关工作流。
黄仁勋发文称 NVIDIA 已从造芯片跨越到创造新的可投资资产类别 AI 工厂基础设施,并称每家公司都会被其驱动、每个国家都会建设它。
NVIDIA 发布 Magpie TTS Multilingual 开放权重模型,参数量 364M,支持英语、西班牙语、法语、德语、意大利语、越南语、普通话、印地语、日语等 12 种语言,新增现代标准阿拉伯语、韩语和巴西葡萄牙语。
推荐理由:NVIDIA 公开 Magpie TTS 多语言模型的权重与延迟数据,读者可据此评估自建语音链路的可行性与成本。
Hugging Face 最新论文提出两项系统改动,让 LLM 知识蒸馏成本大幅下降:先离线缓存教师模型的 top-100 logits,使教师模型无需与学生模型同时驻留显存;再用融合分块 KL 损失,避免生成完整的词表×序列长度矩阵。