Omio 如何用 OpenAI 打造对话式旅行体验
Omio 正借助 OpenAI 构建对话式旅行体验,并推动自身转型为 AI 原生公司。该案例还展示了 Omio 如何用 OpenAI 加速产品开发。
Omio 正借助 OpenAI 构建对话式旅行体验,并推动自身转型为 AI 原生公司。该案例还展示了 Omio 如何用 OpenAI 加速产品开发。
OpenAI 推出新的 Daybreak 工具,包括 Codex Security 和 GPT-5.5-Cyber,帮助各类组织大规模发现、验证并修补漏洞。
推荐理由:OpenAI 推出面向安全场景的 Daybreak 工具,读者可了解其漏洞发现与修复的定位。
Hugging Face 博客分享用本地模型在智能体框架中对 OpenClaw 仓库的 Issue 和 PR 做分类分诊,实现近乎实时的通知且无需云端模型配额。
推荐理由:原文给出本地模型做 PR/Issue 分类的完整架构与 330 行评测数据,可迁移到其他高吞吐分诊场景。
Hugging Face 博客提出 MosaicLeaks,用 1,001 条多跳研究链测试深度研究智能体的隐私泄漏,这些链交替穿插本地企业文档与公开网页信息。测试中智能体频繁泄漏隐私,仅针对任务表现训练会加剧泄漏;其提出的 PA-DR 强化学习方法将严格链成功率从 48.7% 提升至 58.7%,同时把答案/全信息泄漏率从 34.0% 降至 9.9%。
Hugging Face 发布 agent-eval 评测工具,以 transformers 为案例,在模型 × 版本 × 任务三个维度上测量智能体完成任务所需的轮次、token 和错误率,而非只看最终答案。
推荐理由:原文给出了一套可复用的智能体工具评测方法,并展示同一改动如何在大模型与小模型上产生相反效果。
AWS 开源 SDK Strands Robots 将 LeRobot 栈封装为 AgentTools,让一个 Strands 智能体在单次循环中完成从 Hub 数据集到实体机器人的流程。
推荐理由:AWS 团队给出从 Hub 数据集到实体机器人的完整五步流程,可据此理解智能体如何编排 LeRobot 工具链。
OpenAI 与 Molecule.one 展示了一个由 GPT-5.4 驱动的近自主 AI 化学家,它改进了一项关键的制药反应,推进了药物化学研究。
推荐理由:OpenAI 与 Molecule.one 用 GPT-5.4 驱动的近自主 AI 化学家改进药物合成反应,可了解 AI 在实验科学中的落地方式。
智谱发布旗舰模型 GLM-5.2,面向长程任务,首次提供稳定的 1M token 上下文,并以 MIT 许可开源。新架构 IndexShare 让每 4 层稀疏注意力共享同一 indexer,在 1M 上下文下将每 token FLOPs 降低 2.9×,改进后的 MTP 层使投机解码接受长度最高提升 20%。
推荐理由:GLM-5.2 把 1M 上下文与多档思考强度放进开源许可,读者可据此判断长程编码智能体的选型空间。
Hugging Face 发布 Agentic Resource Discovery(ARD)规范的参考实现 Discover Tool,让智能体在运行时按自然语言搜索能力,而不再依赖预先安装。
推荐理由:Hugging Face 给出 ARD 规范的参考实现与 CLI、REST、MCP 三种调用入口,可据此判断智能体能力发现如何从预装目录转向运行时检索。
Google DeepMind 与英国政府、Google Cloud、Faculty 及 Barnet、Dorset、Camden 地方规划部门合作,开发基于 Gemini 的规划审批原型工具,目标是把住户规划申请的处理时间缩短 50%。
Google DeepMind 发布 AI Control Roadmap,一套用于构建和管理 Google 内部部署的高级 AI 的框架,采用纵深防御思路,在模型对齐之外增加系统级安全层。
OpenAI 推出三门 Academy 新课程,帮助人们建立实用 AI 技能、创建可复用工作流,并在日常工作中应用智能体。课程聚焦实际动手能力与可重复流程,面向下一阶段的工作方式。
OpenAI 宣布计划收购 Ona,以扩展 Codex 的安全、持久云环境能力,支持在企业工作流中长时间运行的 AI 智能体。
推荐理由:OpenAI 计划收购 Ona,读者可据此了解 Codex 在持久云环境与长时运行智能体上的布局方向。
Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 并获 Google.org 支持,发起最高 1000 万美元的全球技术研究资助,聚焦大规模多智能体 AI 系统的群体行为与安全风险。
作者让编码智能体通过调用两个 Hugging Face Space 搭建了一个展示巴黎地标的 3D 高斯泼溅网站,全程未手动使用图像生成或 3D 重建工具。每个 Gradio Space 都暴露一份 agents.md,列出 schema URL、调用与轮询模板、文件上传方式和 HF_TOKEN 鉴权提示,智能体据此即可端到端驱动 Space。
推荐理由:作者用两个 Space 串起图像生成到 3D 高斯泼溅的完整流程,展示了 agents.md 如何让智能体直接调用模型。
Hugging Face 宣布 OpenEnv 改由委员会协调,成员包括 Meta-PyTorch、Reflection、Unsloth、Modal、Prime Intellect、Nvidia、Mercor、Fleet AI、Microsoft、Hugging Face 和 RadixArk,项目迁至 huggingface/OpenEnv。
推荐理由:OpenEnv 从单一项目转为多方共管的协议层,读者可据此了解开源智能体 RL 环境的协作方式与接入路径。
Google 在 Gemini Enterprise Agent Platform 上推出由 Agentic RAG 驱动的跨语料检索公开预览版,通过规划、改写、路由与充分上下文智能体迭代检索多源数据。官方称相比标准 RAG,该框架在事实性数据集上准确率最高提升 34%;在跨语料设置下从 4 个候选语料中正确路由并答对 90.1% 的问题,单语料与跨语料版本延迟差异平均在 3% 以内。
推荐理由:原文给出多智能体 RAG 的完整流程与跨语料评测数据,读者可据此判断它在多源检索场景下的可用性。
Endava 正利用 AI 智能体、ChatGPT Enterprise 和 Codex 加速软件交付并自动化工作流,在企业内部构建 AI 原生文化。
OpenAI 为 ChatGPT 引入名为 Dreaming 的新记忆系统,用于更好地记住用户偏好,并在多轮对话之间保持上下文的时效性和相关性。
推荐理由:原文给出 ChatGPT 记忆系统的新变化,读者可据此了解跨对话上下文保持方式的调整。
Hugging Face 重构官方命令行工具 hf CLI,使其同时服务人类用户和 Claude Code、Codex、Cursor 等编码智能体,通过环境变量自动识别智能体并切换输出格式。
H Company 发布 Holo3.1 系列 Computer Use Agent 模型,基于 Qwen 家族,覆盖 0.8B、4B、9B 和 35B-A3B 四种尺寸,并首次提供 FP8、Q4 GGUF 和 NVFP4 量化权重。
推荐理由:原文给出跨环境、跨框架与本地量化部署的具体数据,可据此判断端侧 Computer Use Agent 的落地条件。
Travelers 基于 OpenAI 构建了 AI 理赔助手 Claim Assistant,用于引导客户完成理赔申报并提供 24/7 支持。该助手还能在理赔高峰期帮助 Travelers 扩展业务处理能力,目前已在全美范围内部署。
OpenAI 为 Codex 推出插件、站点和标注功能,面向分析师、市场、设计师、投资者等团队。这些新能力旨在帮助不同角色借助 AI 完成更多工作,覆盖各类工具与工作流场景。
JetBrains 发布 Mellum2,一个从零训练、覆盖自然语言与代码的 12B 参数 MoE 模型,每个 token 仅激活 2.5B 参数,以 Apache 2.0 许可开源。官方称其在相近规模模型中基准表现有竞争力,推理速度超过 2 倍,可用于路由、RAG、摘要、子智能体和高吞吐编码场景。模型已在 Hugging Face 提供下载,技术报告发布在 arXiv(2605.31268)。
推荐理由:JetBrains 开源 12B MoE 模型,每 token 仅激活 2.5B 参数,读者可据此判断它在多模型系统中的定位。
Hugging Face 博客提出,企业 AI 规模化落地的关键不在 LLM 本身,而在"Agent 逻辑"——即知识图谱、算法、程序分析库等运行于智能体层的软件原语,可引导 LLM 聚焦企业工作流、压缩上下文空间。
Google Research 在 I/O 2026 发布 Gemini for Science 实验工具套件,包含基于 ERA 与 AlphaEvolve 的 Computational Discovery、基于 Co-Scientist 的 Hypothesis Generation 以及基于 NotebookLM 的 Literature Insights。
Mistral 在 AI Now Summit 2026 上发布面向工业工程的集成 AI 栈,结合物理模型、工程经验与机器人技术,合作方包括 Airbus、BMW 和 ASML,用于加速设计、消除仿真瓶颈并优化资产性能。
推荐理由:Mistral 把工业工程 AI 栈、Vibe 智能体和自建推理数据中心放在一起发布,可看其企业级全栈布局。
Mistral 将 Le Chat 升级为统一 AI 智能体 Vibe,一个许可证同时覆盖工作与编码场景,原有对话、设置和套餐全部保留。
推荐理由:Mistral 把 Le Chat 升级为统一智能体 Vibe,读者可据此了解其工作模式与编码模式的能力边界和定价分层。
Endava 借助 Codex 构建智能体组织,将需求分析周期从数周缩短至数小时,并加速软件交付。
OpenAI、Thrive 和 Crete 用 Codex 构建了一个可自我改进的税务智能体,用于自动完成报税、提升准确率并加速工作流。该智能体面向税务申报场景,将申报流程自动化。
Warp 正押注用 GPT-5.5 及 OpenAI 模型协调本地、云端与开源开发流程中的编码智能体。该工具将编码智能体贯穿这三类工作流,是其在开源方向上的重要投入。
Hugging Face 发布 AI 智能体术语表,重点厘清 harness、scaffold 与 agent 的区别:model 是 LLM 本身,scaffold 是系统提示词、工具描述与上下文管理等行为定义层,harness 则是调用模型、处理工具调用并决定何时停止的执行层。
Google 在 Nature 发表论文介绍 Empirical Research Assistance(ERA),这是一个用 Gemini 编写和优化科学代码的研究工具,通过树搜索在数千种方案中迭代优化代码。
推荐理由:Google 用 Gemini 驱动的 ERA 在 Nature 发表,并给出流行病、径流、CO2 等八篇应用结果,可看科研编码自动化的边界。
OpenAI 与 Dell 达成合作,将 Codex 引入混合云和本地部署环境,让企业能在自有数据与工作流中安全部署 AI 编程智能体。
Google DeepMind 在实验性原型 Project Genie 中上线 Street View 实景锚定能力,用户可选取美国地点并叠加风格与角色描述,生成起始位置对应真实街景影像的交互世界。
推荐理由:原文给出 Genie 接入 Street View 实景锚定的能力与开放范围,读者可据此判断世界模型在智能体与机器人训练上的落地路径。
Google DeepMind 发布 Gemini for Science,包含 Google Labs 上三个实验性工具和 Google Antigravity 中的 Science Skills。
推荐理由:原文给出三类科学实验工具的能力分工与开放入口,可据此判断智能体在科研流程中的落点。
Google DeepMind 与新加坡政府启动国家 AI 合作,在新加坡落地医疗、科研、教育和气候等项目。合作探索 AI co-clinician 辅助诊疗,并用 AlphaFold、Google Earth 加速东南亚疫情研究,同时向中小学至初级学院教育者提供 Gemini for Education。
Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,主打智能体与编码能力,即日起在 Gemini app、Google Search 的 AI Mode、Google Antigravity、Gemini API 及 Gemini Enterprise 上线。
推荐理由:Gemini 3.5 Flash 在编码与智能体基准上的表现和速度数据,可供读者判断前沿模型在长程任务上的取舍。
Databricks 将 GPT-5.5 用于企业智能体工作流,此前该模型在 OfficeQA Pro 基准上刷新了 SOTA。
OpenAI 在 ChatGPT 中推出个人财务功能,可连接账户、追踪支出与投资、管理订阅、制定预算并规划财务目标。原文未披露该功能的开放范围与上线时间。
推荐理由:OpenAI 在 ChatGPT 内上线个人财务功能,读者可了解其账户连接与预算管理的能力边界。