IBM 与 UC Berkeley 用 ITBench 和 MAST 诊断企业级智能体为何失败
IBM Research 与 UC Berkeley 用 MAST 失败分类法分析 ITBench 中 310 条 SRE 执行轨迹,覆盖 Gemini-3-Flash、Kimi-K2 和 GPT-OSS-120B 三类模型。
IBM Research 与 UC Berkeley 用 MAST 失败分类法分析 ITBench 中 310 条 SRE 执行轨迹,覆盖 Gemini-3-Flash、Kimi-K2 和 GPT-OSS-120B 三类模型。
Hugging Face 博客介绍 Gradio 6 中 gr.HTML 的新能力,支持自定义模板、作用域 CSS 和 JavaScript 交互,可在单个 Python 文件中完成前端、后端与状态管理,无需构建步骤即可部署到 Hugging Face Spaces。
推荐理由:原文给出 gr.HTML 的模板、状态同步与子类化写法,读者可据此把自定义组件直接接入现有 Gradio 流程。
OpenAI 与 Paradigm 联合推出 EVMbench,用于评估 AI 智能体检测、修补和利用高危智能合约漏洞的能力。该基准聚焦高严重性漏洞的发现、修复与攻击三类任务。
Hugging Face 发布 cuda-kernels Agent Skill,让 Claude、Codex 等编码智能体为 diffusers 和 transformers 项目编写生产级 CUDA 内核,并生成 PyTorch 绑定与基准脚本。
推荐理由:原文给出可安装的 CUDA 内核技能与完整基准数据,读者可据此判断智能体写内核的可行边界。
Google DeepMind 发布 Gemini 3 Deep Think 重大升级,这一专用推理模式面向科学、研究与工程难题。
推荐理由:官方给出 Deep Think 在数学、编程与科学基准上的具体成绩和 API 开放路径,可据此判断专业推理模式的当前水位。
Hugging Face 博客介绍 Meta 与 Hugging Face 合作的开源框架 OpenEnv,它用 gym 风格 API(reset、step、action、observations)和标准 MCP 工具调用接口,把智能体接到浏览器、代码仓库、日历等真实系统而非模拟环境中评测。
推荐理由:Meta 与 Hugging Face 的 OpenEnv 框架及 Turing 的 Calendar Gym 给出了智能体在真实权限与多步环境下的失败模式数据。
OpenAI 技术人员 Ryan Lopopolo 提出 Harness engineering,探讨在智能体优先的世界中如何利用 Codex。文章聚焦于围绕 Codex 构建工程化支撑体系,以适应以 AI 智能体为核心的开发范式。
Google Research 在 ACM UIST 2025 发布开源原型框架 DialogLab,用于编写、模拟和测试动态的人-AI 群组对话,将对话的社交设定与时间推进解耦,支持拖拽式场景搭建、实时预览与验证仪表盘。14 名游戏设计、教育和社会科学领域参与者的评测显示,human control 模式在参与度、有效性和真实感上显著优于 autonomous 与 reactive 模式。
Google DeepMind 发布两篇论文,介绍在数学家、物理学家和计算机科学家指导下,用 Gemini Deep Think 模式解决数学、物理与计算机科学领域的专业研究问题。
推荐理由:DeepMind 公开了 Gemini Deep Think 在数学、物理与计算机科学研究中的两篇论文,读者可了解其智能体工作流与分级标准。
Google 提出 Natively Adaptive Interfaces(NAI)框架,用多模态 AI 工具打造更具适应性的无障碍应用,以 agent 驱动的动态模块取代静态导航。原型包括面向盲人与低视力用户的 StreetReaderAI,以及基于 Gemini 模型、可实时语音调整描述细节的 Multimodal Agent Video Player(MAVP)。
OpenAI 发布企业平台 OpenAI Frontier,用于构建、部署和管理 AI 智能体。该平台提供共享上下文、入职引导、权限管理和治理能力。
推荐理由:OpenAI 面向企业推出智能体平台,给出共享上下文、权限与治理等能力方向,可供判断企业级 Agent 落地形态。
OpenAI 发布 GPT-5.3-Codex,这是一个 Codex 原生的智能体,将前沿编码能力与通用推理结合,用于支持长周期、真实世界的技术工作。
推荐理由:OpenAI 发布 Codex 原生的 GPT-5.3-Codex,读者可据此了解其编码能力与通用推理结合后的定位。
OpenAI 介绍 Codex App Server,这是一个双向 JSON-RPC API,用于把 Codex 智能体嵌入到应用中。该接口支持流式进度、工具调用、审批和 diff 等能力。
H Company 发布迄今最大的 UI 定位模型 Holo2-235B-A22B Preview,在 ScreenSpot-Pro 上以 78.5% 刷新 SOTA,OSWorld G 达 79.0%,已在 Hugging Face 开放。
Snowflake 与 OpenAI 达成 2 亿美元合作协议,把前沿智能引入企业数据,让 AI 智能体和洞察直接在 Snowflake 中运行。
OpenAI 发布面向 macOS 的 Codex app,定位为 AI 编码与软件开发的指挥中心,支持多个智能体、并行工作流和长时间运行的任务。
推荐理由:官方给出 Codex app 的定位与多智能体、并行工作流等能力,读者可据此判断 AI 编码工具形态的变化。
OpenAI 构建了一个内部 AI 数据智能体,结合 GPT-5、Codex 和记忆能力对海量数据集进行推理,可在数分钟内给出可靠洞察。
Gradio 团队发布开源 Python 库 Daggr,用于把 Gradio 应用、ML 模型和自定义函数串联成 AI 工作流,并自动生成可视化画布。它支持检查任意节点输出、修改输入并单独重跑某一步,还提供状态持久化和 sheets 多工作区,安装只需 Python 3.10 以上并执行 pip install daggr。
推荐理由:原文给出代码优先的编排方式和可视化画布,读者可据此判断它是否适合替代现有调试脚本。
Google Research 发布论文《Towards a Science of Scaling Agent Systems》,对 180 种智能体配置做大规模对照评测,覆盖 Finance-Agent、BrowseComp-Plus、PlanCraft、Workbench 四个基准和 GPT、Gemini、Claude 三个模型家族。
推荐理由:通过 180 种智能体配置的对照实验,给出多智能体架构在并行与串行任务上的量化差异,可据此调整编排策略。
Hugging Face 发布新工具 upskill,可用大模型生成并评测 agent skill,再交给更小或本地模型使用。文章以用 Claude Opus 4.5 编写 diffusers 模型 CUDA kernel 为例,upskill 会基于 agent trace 生成技能和测试用例,并对比有无技能时的准确率与 token 消耗。
推荐理由:原文给出用大模型生成并评测 agent skill 再迁移到小模型的完整流程,可复用到其他专业任务。
OpenAI 说明了 AI 智能体打开链接时保护用户数据的机制,通过内置防护防止基于 URL 的数据外泄和提示词注入。
Mistral 发布终端编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型系列驱动,新增自定义子智能体、多选项澄清、斜杠命令技能和统一智能体模式,CLI 修复持续自动更新。
推荐理由:官方给出 Vibe 2.0 的自定义子智能体、斜杠命令技能与定价变化,可据此判断终端编码智能体的使用成本与工作流。
Hugging Face 博客复盘了用 verl 框架对 GPT-OSS 进行智能体强化学习训练时遇到的问题与修复。团队发现 GPT-OSS-20B 训练初期出现 KL 散度和熵爆炸、奖励不升,根因是 MoE 架构下双前向传播导致新旧 log-prob 不一致,使 PPO 的 importance sampling ratio 偏离 1;修复后该方案同样适用于 GPT-OSS-120B。
TRUSTBANK 与 Recursive 合作,基于 OpenAI 模型打造了 Choice AI,通过个性化对话式推荐简化故乡税(Furusato Nozei)礼品的挑选流程。
OpenAI 技术解析 Codex 智能体循环,说明 Codex CLI 如何借助 Responses API 编排模型、工具、提示词与性能。
Praktika 基于 GPT-4.1 和 GPT-5.2 构建自适应 AI 导师,通过对话方式提供个性化课程、跟踪学习进度,帮助学习者实现真实场景的语言流利度。
Hugging Face 发布 AssetOpsBench,一个面向工业资产运维的智能体评测基准,包含 2.3M 传感器遥测点、140+ 场景、4.2K 工单和 53 种结构化故障模式,覆盖 4 个智能体。
OpenAI 发起、开源社区共建、Hugging Face 生态支持的 Open Responses 发布,它基于 Responses API 开源扩展,定位为面向智能体的开放推理标准。
推荐理由:原文给出 Open Responses 的规范要点与迁移差异,读者可据此判断现有 Responses API 客户端需要改什么。
Netomi 借助 GPT-4.1 和 GPT-5.2 扩展企业级 AI 智能体,通过并发、治理与多步推理支撑可靠的生产工作流。该方案面向企业生产环境,强调智能体系统在规模化部署中的稳定性与可控性。
OpenAI 推出 ChatGPT Health,这是一个独立的使用体验,可安全连接用户的健康数据与 App。该功能强调隐私保护,并采用由医生参与设计的方案。
推荐理由:OpenAI 推出独立的健康使用场景,读者可了解它如何接入健康数据与 App 并处理隐私。
NVIDIA 在 CES 2026 发布博客,给出用 DGX Spark 与 Reachy Mini 搭建桌面个人智能体的分步教程,演示代码已开源。
Hugging Face 发布 8B 参数安全护栏模型 AprielGuard,可检测 16 类安全风险及提示注入、越狱、思维链污染、记忆投毒、多智能体攻击等对抗攻击,并覆盖工具调用与推理轨迹等智能体工作流。模型提供推理与非推理两种模式,兼顾可解释分类与低延迟生产部署。训练数据由 Mixtral-8x7B 等合成生成,并借助 NVIDIA NeMo Curator 构建多轮对话攻击数据集。
OpenAI 正在用强化学习训练的自动化红队加固 ChatGPT Atlas,抵御提示词注入攻击。这一发现与修补的循环可提前识别新型攻击手法,在 AI 愈发智能体的趋势下强化浏览器智能体的防御。
OpenAI 宣布开发者可以向 ChatGPT 提交应用,经审核通过后会在产品内新的应用目录中展示,便于用户发现。官方同时更新了工具、指南和 Apps SDK,帮助开发者构建把真实操作带入 ChatGPT 的对话原生体验。
推荐理由:OpenAI 开放 ChatGPT 应用提交与审核入口,开发者可据此判断自家应用进入该生态的路径。
CUGA(Configurable Generalist Agent)是 IBM Research 推出的开源可配置通用智能体,采用 Apache 2.0 许可,现已集成到 Hugging Face Spaces 供试用。
Google DeepMind 发布升级版 Gemini 2.5 Flash Native Audio,面向实时语音智能体,在函数调用、指令遵循和多轮对话三方面做了改进。
推荐理由:官方给出 Gemini 2.5 Flash Native Audio 在函数调用、指令遵循和多轮对话上的具体提升数据,可据此判断语音智能体的可用性变化。
BNY 正通过 OpenAI 在全企业范围扩大 AI 应用,其平台 Eliza 已支持 20000 多名员工构建 AI 智能体,以提升效率并改善客户成果。
Podium 基于 OpenAI 的 GPT-5 构建了 AI 队友“Jerry”,为 10,000+ 中小企业提供服务,并带来 300% 增长。该智能体正在改变实体商家服务客户的方式。
Hugging Face 发布教程,展示如何让 OpenAI Codex 借助 Hugging Face Skills 仓库完成端到端模型微调实验。
推荐理由:原文给出可复用的 HF-skills 配置与端到端微调流程,读者可据此把训练实验交给编码智能体执行。
Scout24 基于 GPT-5 打造了一款对话式助手,通过追问澄清、生成摘要和个性化房源推荐,重新定义房产搜索体验。