Google DeepMind 发布 AI Control Roadmap,用纵深防御管控内部 AI 智能体
Google DeepMind 发布 AI Control Roadmap,一套用于构建和管理 Google 内部部署的高级 AI 的框架,采用纵深防御思路,在模型对齐之外增加系统级安全层。
Google DeepMind 发布 AI Control Roadmap,一套用于构建和管理 Google 内部部署的高级 AI 的框架,采用纵深防御思路,在模型对齐之外增加系统级安全层。
作者让 Claude Fable 5 逆向一款没有源码的 1993 年 DOS 游戏,模型读取原始机器码后用 C 重写引擎,产出可在各平台编辑的移植版,从 EXE 到 iPhone 用时 30 分钟。作者表示会公开全部过程,供他人复活自己的童年游戏。
OpenAI 推出三门 Academy 新课程,帮助人们建立实用 AI 技能、创建可复用工作流,并在日常工作中应用智能体。课程聚焦实际动手能力与可重复流程,面向下一阶段的工作方式。
OpenAI 宣布计划收购 Ona,以扩展 Codex 的安全、持久云环境能力,支持在企业工作流中长时间运行的 AI 智能体。
推荐理由:OpenAI 计划收购 Ona,读者可据此了解 Codex 在持久云环境与长时运行智能体上的布局方向。
Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 并获 Google.org 支持,发起最高 1000 万美元的全球技术研究资助,聚焦大规模多智能体 AI 系统的群体行为与安全风险。
作者让编码智能体通过调用两个 Hugging Face Space 搭建了一个展示巴黎地标的 3D 高斯泼溅网站,全程未手动使用图像生成或 3D 重建工具。每个 Gradio Space 都暴露一份 agents.md,列出 schema URL、调用与轮询模板、文件上传方式和 HF_TOKEN 鉴权提示,智能体据此即可端到端驱动 Space。
推荐理由:作者用两个 Space 串起图像生成到 3D 高斯泼溅的完整流程,展示了 agents.md 如何让智能体直接调用模型。
本期 Import AI 汇总三项研究。伦敦国王学院、复旦大学与 Alan Turing Institute 构建了 SocioHack 基准,包含 72 个沙盒社会环境,测试 RL 训练的模型能否发现合规但违背制度意图的漏洞,模型在历史法规环境中以 61.25% 召回率和 90.85% 精确率重新发现已被修补的漏洞。
Hugging Face 宣布 OpenEnv 改由委员会协调,成员包括 Meta-PyTorch、Reflection、Unsloth、Modal、Prime Intellect、Nvidia、Mercor、Fleet AI、Microsoft、Hugging Face 和 RadixArk,项目迁至 huggingface/OpenEnv。
推荐理由:OpenEnv 从单一项目转为多方共管的协议层,读者可据此了解开源智能体 RL 环境的协作方式与接入路径。
Google 在 Gemini Enterprise Agent Platform 上推出由 Agentic RAG 驱动的跨语料检索公开预览版,通过规划、改写、路由与充分上下文智能体迭代检索多源数据。官方称相比标准 RAG,该框架在事实性数据集上准确率最高提升 34%;在跨语料设置下从 4 个候选语料中正确路由并答对 90.1% 的问题,单语料与跨语料版本延迟差异平均在 3% 以内。
推荐理由:原文给出多智能体 RAG 的完整流程与跨语料评测数据,读者可据此判断它在多源检索场景下的可用性。
Endava 正利用 AI 智能体、ChatGPT Enterprise 和 Codex 加速软件交付并自动化工作流,在企业内部构建 AI 原生文化。
OpenAI 为 ChatGPT 引入名为 Dreaming 的新记忆系统,用于更好地记住用户偏好,并在多轮对话之间保持上下文的时效性和相关性。
推荐理由:原文给出 ChatGPT 记忆系统的新变化,读者可据此了解跨对话上下文保持方式的调整。
Hugging Face 重构官方命令行工具 hf CLI,使其同时服务人类用户和 Claude Code、Codex、Cursor 等编码智能体,通过环境变量自动识别智能体并切换输出格式。
H Company 发布 Holo3.1 系列 Computer Use Agent 模型,基于 Qwen 家族,覆盖 0.8B、4B、9B 和 35B-A3B 四种尺寸,并首次提供 FP8、Q4 GGUF 和 NVFP4 量化权重。
推荐理由:原文给出跨环境、跨框架与本地量化部署的具体数据,可据此判断端侧 Computer Use Agent 的落地条件。
Travelers 基于 OpenAI 构建了 AI 理赔助手 Claim Assistant,用于引导客户完成理赔申报并提供 24/7 支持。该助手还能在理赔高峰期帮助 Travelers 扩展业务处理能力,目前已在全美范围内部署。
OpenAI 为 Codex 推出插件、站点和标注功能,面向分析师、市场、设计师、投资者等团队。这些新能力旨在帮助不同角色借助 AI 完成更多工作,覆盖各类工具与工作流场景。
JetBrains 发布 Mellum2,一个从零训练、覆盖自然语言与代码的 12B 参数 MoE 模型,每个 token 仅激活 2.5B 参数,以 Apache 2.0 许可开源。官方称其在相近规模模型中基准表现有竞争力,推理速度超过 2 倍,可用于路由、RAG、摘要、子智能体和高吞吐编码场景。模型已在 Hugging Face 提供下载,技术报告发布在 arXiv(2605.31268)。
推荐理由:JetBrains 开源 12B MoE 模型,每 token 仅激活 2.5B 参数,读者可据此判断它在多模型系统中的定位。
Hugging Face 博客提出,企业 AI 规模化落地的关键不在 LLM 本身,而在"Agent 逻辑"——即知识图谱、算法、程序分析库等运行于智能体层的软件原语,可引导 LLM 聚焦企业工作流、压缩上下文空间。
Google Research 在 I/O 2026 发布 Gemini for Science 实验工具套件,包含基于 ERA 与 AlphaEvolve 的 Computational Discovery、基于 Co-Scientist 的 Hypothesis Generation 以及基于 NotebookLM 的 Literature Insights。
Mistral 在 AI Now Summit 2026 上发布面向工业工程的集成 AI 栈,结合物理模型、工程经验与机器人技术,合作方包括 Airbus、BMW 和 ASML,用于加速设计、消除仿真瓶颈并优化资产性能。
推荐理由:Mistral 把工业工程 AI 栈、Vibe 智能体和自建推理数据中心放在一起发布,可看其企业级全栈布局。
Mistral 将 Le Chat 升级为统一 AI 智能体 Vibe,一个许可证同时覆盖工作与编码场景,原有对话、设置和套餐全部保留。
推荐理由:Mistral 把 Le Chat 升级为统一智能体 Vibe,读者可据此了解其工作模式与编码模式的能力边界和定价分层。
Endava 借助 Codex 构建智能体组织,将需求分析周期从数周缩短至数小时,并加速软件交付。
OpenAI、Thrive 和 Crete 用 Codex 构建了一个可自我改进的税务智能体,用于自动完成报税、提升准确率并加速工作流。该智能体面向税务申报场景,将申报流程自动化。
Warp 正押注用 GPT-5.5 及 OpenAI 模型协调本地、云端与开源开发流程中的编码智能体。该工具将编码智能体贯穿这三类工作流,是其在开源方向上的重要投入。
Hugging Face 发布 AI 智能体术语表,重点厘清 harness、scaffold 与 agent 的区别:model 是 LLM 本身,scaffold 是系统提示词、工具描述与上下文管理等行为定义层,harness 则是调用模型、处理工具调用并决定何时停止的执行层。
Google 在 Nature 发表论文介绍 Empirical Research Assistance(ERA),这是一个用 Gemini 编写和优化科学代码的研究工具,通过树搜索在数千种方案中迭代优化代码。
推荐理由:Google 用 Gemini 驱动的 ERA 在 Nature 发表,并给出流行病、径流、CO2 等八篇应用结果,可看科研编码自动化的边界。
OpenAI 与 Dell 达成合作,将 Codex 引入混合云和本地部署环境,让企业能在自有数据与工作流中安全部署 AI 编程智能体。
Google DeepMind 在实验性原型 Project Genie 中上线 Street View 实景锚定能力,用户可选取美国地点并叠加风格与角色描述,生成起始位置对应真实街景影像的交互世界。
推荐理由:原文给出 Genie 接入 Street View 实景锚定的能力与开放范围,读者可据此判断世界模型在智能体与机器人训练上的落地路径。
Google DeepMind 发布 Gemini for Science,包含 Google Labs 上三个实验性工具和 Google Antigravity 中的 Science Skills。
推荐理由:原文给出三类科学实验工具的能力分工与开放入口,可据此判断智能体在科研流程中的落点。
Google DeepMind 与新加坡政府启动国家 AI 合作,在新加坡落地医疗、科研、教育和气候等项目。合作探索 AI co-clinician 辅助诊疗,并用 AlphaFold、Google Earth 加速东南亚疫情研究,同时向中小学至初级学院教育者提供 Gemini for Education。
Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,主打智能体与编码能力,即日起在 Gemini app、Google Search 的 AI Mode、Google Antigravity、Gemini API 及 Gemini Enterprise 上线。
推荐理由:Gemini 3.5 Flash 在编码与智能体基准上的表现和速度数据,可供读者判断前沿模型在长程任务上的取舍。
Databricks 将 GPT-5.5 用于企业智能体工作流,此前该模型在 OfficeQA Pro 基准上刷新了 SOTA。
OpenAI 在 ChatGPT 中推出个人财务功能,可连接账户、追踪支出与投资、管理订阅、制定预算并规划财务目标。原文未披露该功能的开放范围与上线时间。
推荐理由:OpenAI 在 ChatGPT 内上线个人财务功能,读者可了解其账户连接与预算管理的能力边界。
Sea Limited 首席产品官宣布在工程团队中全面部署 OpenAI Codex,以加速亚洲地区的 AI 原生软件开发。该部署旨在推动智能体式(agentic)软件开发模式在 Sea 内部的落地。
OpenAI 宣布 Codex 可在 ChatGPT 移动端使用,用户能跨设备和远程环境实时监控、引导并批准编码任务。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,这是一个基于 Gemini 构建的多智能体 AI 系统,可迭代生成、辩论和演化复杂科学问题的新假设。
推荐理由:原文披露了多智能体系统的三阶段协作机制与跨机构验证案例,可了解AI参与科学假设生成的具体路径。
OpenAI 的 Parameter Golf 活动吸引 1000+ 名参与者、收到 2000+ 份提交,探索 AI 辅助机器学习研究、编码智能体、量化与新型模型设计。活动在严格约束条件下进行。
OpenAI 通过沙箱隔离、审批机制、网络策略和智能体原生遥测来安全运行 Codex,以支持安全合规地采用编码智能体。
Parloa 利用 OpenAI 模型打造可扩展的语音驱动 AI 客服智能体,让企业能够设计、模拟并部署可靠的实时交互。
Google DeepMind 回顾了 Gemini 驱动的编码智能体 AlphaEvolve 发布一年来的应用进展,称其已从试点成为 Google 基础设施的核心组件,用于优化下一代 TPU 设计和缓存替换策略。
推荐理由:原文汇总了 AlphaEvolve 在基因组、电网、量子物理和商业客户中的落地数据,可据此判断编码智能体的跨领域适用范围。
OpenAI 的 B2B Signals 研究显示,前沿企业正通过深化 AI 采用、规模化 Codex 驱动的智能体工作流来构建持久的竞争优势。该研究聚焦企业级 AI 落地路径,揭示前沿企业与其余公司之间正在拉大的差距。