模型路由并不简单:从分类问题到系统优化问题
在 AppWorld Test Challenge 的 417 个任务上,同一 CodeAct 智能体下 Claude Sonnet 4.6 总成本 79 美元(0.19 美元/任务),GPT-4.1 却要 155 美元(0.37 美元/任务),尽管后者 token 单价更低——缓存命中率才是关键。
在 AppWorld Test Challenge 的 417 个任务上,同一 CodeAct 智能体下 Claude Sonnet 4.6 总成本 79 美元(0.19 美元/任务),GPT-4.1 却要 155 美元(0.37 美元/任务),尽管后者 token 单价更低——缓存命中率才是关键。
OpenAI 提出"反向联邦制"AI 治理思路,主张由州级法律逐步构建全国性的安全、民主 AI 框架。该方案将州立法视为联邦层面统一规则的构建基础,而非彼此冲突的碎片化监管。
OpenAI 推出自动化红队系统 GPT-Red,通过自博弈提升 AI 安全、对齐与提示词注入鲁棒性。该系统面向红队测试场景,用于自动发现模型弱点并驱动鲁棒性自我改进。
Thinking Machines Lab 在 Hugging Face 发布多模态开源模型 Inkling,采用 decoder-only MoE 架构,975B 总参数、41B 激活参数,支持图像、音频、文本输入和 1M 上下文,训练数据为 45 万亿 token。
推荐理由:Inkling 以约 1T 参数、1M 上下文原生接收图像音频文本,并给出各推理引擎的部署配置与基准对比。
Hugging Face 发布 Real World VoiceEQ 基准,用于评估语音交互的"人类质感",覆盖 40 多个专有与开源语音模型、15+ 评估维度和 60+ 指标,涵盖 ASR、TTS、S2S 与语音理解。
OpenAI 提出企业在智能体时代应以"每美元有效工作量"衡量 AI 投资回报,通过提升效率并扩展高价值工作流来管理投入。
ChatGPT Work 可用于数据科学工作流,覆盖根因简报、KPI 备忘录、范围界定分析和仪表盘规格四类任务。内容以实操方式讲解这些工作流的具体用法。
OpenAI 介绍 ChatGPT Work 在销售场景中的实用工作流,覆盖 pipeline briefs、会议准备、客户计划、预测复盘和交易诊断。
Google DeepMind 面向印度 Atal Tinkering Labs 启动 ATL Saathi 试点,这是一款由 Gemini 驱动的 Web 应用,为每位 Tinkering Lab 教育者提供 24/7 备课与培训助手。
Deutsche Telekom 正借助 OpenAI 转型为 AI 原生电信运营商,改造客户服务、员工工作流、网络运营以及语音的未来。
Hugging Face 博客发布 "Profiling in PyTorch" 系列第三篇,用 NVIDIA A100-SXM4-80GB 剖析 attention 的 profiler 轨迹。
OpenAI 发布 ChatGPT 入门指南,介绍如何开始第一次对话,并给出用 AI 写作、头脑风暴和解决问题的简单方法。
OpenAI 宣布 GPT-5.6 成为 Microsoft 365 Copilot 的首选模型,为 Word、Excel、PowerPoint、Chat 和 Cowork 提供更强的 AI 能力,以实现更快、更高质量的工作。
推荐理由:OpenAI 官方说明 GPT-5.6 成为 Microsoft 365 Copilot 首选模型,读者可了解其在 Word、Excel 等应用中的能力变化。
Mistral 宣布 Studio 即日起为 Prompts 和 Skills 提供集中管理系统,每个资产可版本化、指定归属并追溯。Studio 将提示词和技能视为生产资产,提供不可变版本、回滚、分类标签和审计日志,并可通过 SDK 接入 GitHub Actions 触发 CI/CD。技能可作为 MCP 服务器直接从 Studio 调用,生产执行的与版本化的资产保持一致。
推荐理由:原文给出提示词与技能版本化、归属和审计的具体机制,读者可据此判断企业如何治理 AI 行为。
OpenAI 推出 GPT-5.5 Bio Bug Bounty 计划,面向生物领域征集模型漏洞。该计划的具体细节已随公告一并公布。
OpenAI 发布 GPT-5.6,官方称其在每个 token 上提供更高智能、每美元更强性能,并可按需为高难度任务提供更多能力。
OpenAI 发布 ChatGPT Work,这是一个可在多个应用和文件间执行操作的智能体。它能在需要时为同一项目持续工作数小时,并把一个目标转化为完成的工作成果。
推荐理由:官方给出 ChatGPT Work 的定位,读者可据此判断智能体跨应用执行任务的能力边界。
Google Research 发布 SensorFM,一个直接从无标注可穿戴数据学习的大型传感器基础模型,预训练语料来自五百万名同意参与者、超过一万亿分钟的多模态传感器信号,覆盖 100 多个国家和 20 多种 Fitbit 与 Pixel Watch 设备。
OpenAI 阐述了其与政府和国家安全机构合作的原则,强调负责任地使用 AI、民主问责与公共安全。
OpenAI 发布新分析,指出流行编码基准 SWE-Bench Pro 存在可靠性与准确性方面的问题。该分析揭示了这一用于评估 AI 模型的基准在评测中可能产生误导性结果。
Mistral AI 发布首个具身导航模型 Robostral Navigate,这是一个 8B 模型,仅用单个普通 RGB 相机、无需 LiDAR 或深度传感器,在 R2R-CE validation unseen 上达到 76.6% 成功率,比最佳单相机方案高 9.7 个百分点,比使用深度或多相机的最佳系统高 4.5 个百分点。
推荐理由:官方给出单目 RGB 相机在 R2R-CE 上的成绩与训练方法,可对比多传感器方案的成本与效果。
OpenAI Academy 与 Walton Family Foundation 合作推出动手实践的 AI Skills Jams,帮助 K–12 教育工作者掌握课堂实用的 AI 技能。
OpenAI 发布新一代语音模型 GPT-Live,面向更自然的人机交互,目前已用于驱动 ChatGPT Voice。
推荐理由:OpenAI 发布新一代语音模型 GPT-Live,读者可了解它已接入 ChatGPT Voice 这一落地位置。
Hugging Face 宣布 vLLM 的 transformers 建模后端现已达到甚至超过 vLLM 手写原生实现的吞吐速度,模型作者无需移植即可获得快速推理。
推荐理由:原文给出 transformers 后端在 vLLM 中追平原生实现的具体基准与启用方式,读者可据此判断是否省去自定义移植。
Hugging Face 与 Amazon SageMaker AI 推出深度链接集成,开发者在支持的模型页面点击 Customize 或 Deploy 即可直达 SageMaker Studio,模型预加载、环境自动配置。
Google Research 在 10 座美国城市开展大规模实验,通过修改 Google Maps 算法将不到 2% 的行程引导至拥堵路段之外的替代路线,使目标路段行驶速度中位数提升约 2%,燃油消耗率中位数下降 0.5% 至 1.0%。
微软在 Build 2026 宣布 Foundry Managed Compute 及 Hugging Face 模型集合,将 Hugging Face 生态的开源权重模型引入 Foundry 模型目录,每周刷新并可一键部署到托管 GPU 平台。
伯克利 EPIC Data Lab 提出,随着推理成本从 2023 年初 GPT-4 级约 $30/百万 token 降至如今不足 $1、部分厂商低于 $0.10,数据系统需应对三大新挑战:为智能体设计的数据系统、运行智能体集群的数据系统、以及由智能体合成的数据系统。在 text-to-SQL 基准上,多智能体尝试同一任务时仅 10-20% 子计划不同,80-90% 子查询存在重复计算。
Australian Payments Plus 使用 ChatGPT Enterprise 和 Codex 应对支付业务的复杂性,实现节省时间、提升质量,同时保留人工判断。
LeRobot v0.6.0 发布,围绕机器人学习闭环引入世界模型策略(VLA-JEPA、FastWAM、LingBot-VA)、新一批 VLA(GR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiT)以及统一奖励模型 API(Robometer、TOPReward)。
推荐理由:LeRobot v0.6.0 把世界模型策略、奖励模型 API 与六个仿真基准整合进同一套开源工作流,读者可据此判断机器人学习闭环的落地路径。
三菱日联金融集团(MUFG)正借助 ChatGPT Enterprise 构建 AI 原生组织,以改进工作流程并规模化交付新的 AI 金融服务。
Hugging Face 与 SkyPilot 联合推出集成,用户可用一个 hf:// URL 和现有 HF_TOKEN 把 Hugging Face Bucket 或任意模型、数据集、Space 仓库挂载进 SkyPilot 任务,并在 20+ 云、Kubernetes、Slurm 和本地集群上运行。
推荐理由:原文给出 hf:// 挂载方式、免出网费与 Xet 去重的具体机制,读者可据此判断跨云训练存储成本的变化。
Hugging Face 在 PRX 系列第四篇中披露其数据策略:预训练数据由公开与内部数据集混合组成,用 VLM 重新生成图像长描述,再转为可流式训练的语料。团队将文本编码器从 T5Gemma 换成 Qwen3-VL 并改为训练时实时计算文本 latent,实测吞吐损失约 3–4%(30 天训练约多 1 天)。图像统一以 JPEG quality 92 编码,实测首次重编码几乎不可察觉。
Hugging Face 为 Kernels 项目引入 Hub 上的 "kernel" 新仓库类型,并默认只加载受信任发布者的内核,其他来源需显式传入 trust_remote_code=True。
Google DeepMind 与 A24 宣布达成首个聚焦研究的合作伙伴关系,双方将围绕多个项目展开长期研发协作,让 A24 及其电影人参与塑造新技术。Google 同时已对 A24 进行投资。该合作初期聚焦弥合前沿技术与下一代娱乐之间的差距,具体目标与技术产出将随时间演进。
伯克利人工智能研究实验室(BAIR)公布 2026 届博士毕业生名单,研究方向覆盖机器人、具身智能、大语言模型与推理、计算机视觉、生成模型、AI 安全、人机交互及 AI for Science 与医疗。毕业生去向包括 Physical Intelligence、OpenAI、Mistral AI、Amazon 等机构,以及 UCLA、芝加哥大学教职和自主创业。
Hugging Face 与 Cerebras 联合演示了一套实时语音到语音流水线,用 Cerebras 加速 Gemma 4 31B 的推理,以降低语音交互延迟。
推荐理由:原文给出可替换的语音到语音流水线各层组件,读者可据此评估如何搭建低延迟实时语音交互。
Hugging Face 发布开源基准 ScarfBench,用于评估 AI 智能体在企业级 Java 框架迁移中的表现,覆盖 Spring、Jakarta EE、Quarkus 三大生态,含 34 个应用、102 个框架实现、204 个迁移任务和 1331 个专家测试。
Google Research 将建筑级屋顶反射率数据集从 14 城扩展至 50+ 城市,覆盖 9 个国家,并通过新的 Heat Resilience Earth Engine App 开放访问。该方法融合 Sentinel-2 与 30-cm 高分辨率卫星影像,在 Boulder 验证中 RMSE 仅 0.04,建模显示针对性冷屋顶规划可使全球城市极端高温降低最多 0.5°C。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)和 Gemini Omni Flash(gemini-omni-flash-preview)两款模型,前者是 Nano Banana 家族中速度最快、成本最低的图像模型,后者支持高质量视频生成与对话式编辑。
推荐理由:Google DeepMind 同时放出图像与视频两款新模型,并给出延迟、单价和可用入口,便于开发者评估替换与串联方案。