TRUSTBANK 用 AI 智能体个性化推荐故乡税礼品
TRUSTBANK 与 Recursive 合作,基于 OpenAI 模型打造了 Choice AI,通过个性化对话式推荐简化故乡税(Furusato Nozei)礼品的挑选流程。
TRUSTBANK 与 Recursive 合作,基于 OpenAI 模型打造了 Choice AI,通过个性化对话式推荐简化故乡税(Furusato Nozei)礼品的挑选流程。
OpenAI 技术解析 Codex 智能体循环,说明 Codex CLI 如何借助 Responses API 编排模型、工具、提示词与性能。
Praktika 基于 GPT-4.1 和 GPT-5.2 构建自适应 AI 导师,通过对话方式提供个性化课程、跟踪学习进度,帮助学习者实现真实场景的语言流利度。
Hugging Face 发布 AssetOpsBench,一个面向工业资产运维的智能体评测基准,包含 2.3M 传感器遥测点、140+ 场景、4.2K 工单和 53 种结构化故障模式,覆盖 4 个智能体。
OpenAI 发起、开源社区共建、Hugging Face 生态支持的 Open Responses 发布,它基于 Responses API 开源扩展,定位为面向智能体的开放推理标准。
推荐理由:原文给出 Open Responses 的规范要点与迁移差异,读者可据此判断现有 Responses API 客户端需要改什么。
Netomi 借助 GPT-4.1 和 GPT-5.2 扩展企业级 AI 智能体,通过并发、治理与多步推理支撑可靠的生产工作流。该方案面向企业生产环境,强调智能体系统在规模化部署中的稳定性与可控性。
OpenAI 推出 ChatGPT Health,这是一个独立的使用体验,可安全连接用户的健康数据与 App。该功能强调隐私保护,并采用由医生参与设计的方案。
推荐理由:OpenAI 推出独立的健康使用场景,读者可了解它如何接入健康数据与 App 并处理隐私。
NVIDIA 在 CES 2026 发布博客,给出用 DGX Spark 与 Reachy Mini 搭建桌面个人智能体的分步教程,演示代码已开源。
Hugging Face 发布 8B 参数安全护栏模型 AprielGuard,可检测 16 类安全风险及提示注入、越狱、思维链污染、记忆投毒、多智能体攻击等对抗攻击,并覆盖工具调用与推理轨迹等智能体工作流。模型提供推理与非推理两种模式,兼顾可解释分类与低延迟生产部署。训练数据由 Mixtral-8x7B 等合成生成,并借助 NVIDIA NeMo Curator 构建多轮对话攻击数据集。
OpenAI 正在用强化学习训练的自动化红队加固 ChatGPT Atlas,抵御提示词注入攻击。这一发现与修补的循环可提前识别新型攻击手法,在 AI 愈发智能体的趋势下强化浏览器智能体的防御。
OpenAI 宣布开发者可以向 ChatGPT 提交应用,经审核通过后会在产品内新的应用目录中展示,便于用户发现。官方同时更新了工具、指南和 Apps SDK,帮助开发者构建把真实操作带入 ChatGPT 的对话原生体验。
推荐理由:OpenAI 开放 ChatGPT 应用提交与审核入口,开发者可据此判断自家应用进入该生态的路径。
CUGA(Configurable Generalist Agent)是 IBM Research 推出的开源可配置通用智能体,采用 Apache 2.0 许可,现已集成到 Hugging Face Spaces 供试用。
Google DeepMind 发布升级版 Gemini 2.5 Flash Native Audio,面向实时语音智能体,在函数调用、指令遵循和多轮对话三方面做了改进。
推荐理由:官方给出 Gemini 2.5 Flash Native Audio 在函数调用、指令遵循和多轮对话上的具体提升数据,可据此判断语音智能体的可用性变化。
BNY 正通过 OpenAI 在全企业范围扩大 AI 应用,其平台 Eliza 已支持 20000 多名员工构建 AI 智能体,以提升效率并改善客户成果。
Podium 基于 OpenAI 的 GPT-5 构建了 AI 队友“Jerry”,为 10,000+ 中小企业提供服务,并带来 300% 增长。该智能体正在改变实体商家服务客户的方式。
Hugging Face 发布教程,展示如何让 OpenAI Codex 借助 Hugging Face Skills 仓库完成端到端模型微调实验。
推荐理由:原文给出可复用的 HF-skills 配置与端到端微调流程,读者可据此把训练实验交给编码智能体执行。
Scout24 基于 GPT-5 打造了一款对话式助手,通过追问澄清、生成摘要和个性化房源推荐,重新定义房产搜索体验。
Mistral AI 发布新一代编码模型家族 Devstral 2,包含 123B 的 Devstral 2 和 24B 的 Devstral Small 2,两者均为开源模型,分别采用修改版 MIT 和 Apache 2.0 许可。
推荐理由:官方给出两款开源编码模型的参数、许可与 SWE-bench 成绩,并附与闭源模型的对比,便于判断开源编码模型的当前水位。
OpenAI 在 Linux 基金会下联合发起 Agentic AI Foundation,并将 AGENTS.md 捐赠给该基金会。该基金会旨在支持开放、可互操作的标准,以推动安全智能体 AI 的发展。
推荐理由:OpenAI 把 AGENTS.md 捐给 Linux 基金会下的新基金会,读者可据此了解智能体标准与开源治理的走向。
OpenAI 与 Instacart 深化长期合作,将首个完全集成的杂货购物与 Instant Checkout 支付应用引入 ChatGPT。
Hugging Face 发布 Hugging Face Skills,其中 hf-llm-trainer 技能让 Claude Code、Codex、Gemini CLI 等编码智能体直接提交云端 GPU 训练任务、监控进度并把模型推送到 Hub。
推荐理由:原文给出 hf-llm-trainer 技能的安装命令与完整训练流程,读者可据此让编码智能体代跑微调任务。
Mirakl 正借助 AI 智能体与 ChatGPT Enterprise 重塑电商,实现更快的文档撰写和更智能的客户支持,并朝智能体原生电商方向发展。该公司还在构建 Mirakl Nexus,以推进其智能体电商愿景。
Accenture 与 OpenAI 正展开合作,帮助企业将智能体 AI 能力引入业务核心,以释放新的增长空间。
Tavily 分享了构建 SOTA 深度研究智能体的经验:七个月前其第一版架构因假设过于复杂,在下一代模型到来时成为瓶颈,团队被迫推倒重建。新方案简化编排逻辑、强调自主性,并借助 Tavily Advanced Search 在工具侧完成上下文工程,只返回最相关内容块以降低模型幻觉与延迟。团队还提出将工具输出蒸馏为反思、仅在生成最终交付物时注入原始信息,以模拟人类研究方式管理上下文窗口。
Google DeepMind 宣布支持白宫 Genesis Mission,并与美国能源部合作,向 DOE 全部 17 个国家实验室提供前沿 AI for Science 模型和智能体工具的加速访问计划,首批上线的是基于 Gemini 的 AI co-scientist。
推荐理由:Google DeepMind 与 DOE 的合作给出了 AI for Science 从模型到国家实验室落地的具体路径,可观察前沿模型在科研场景的接入方式。
OpenAI 发布 GPT-5.1-Codex-Max 系统卡,详述该模型的安全措施。模型层面包括针对有害任务和提示词注入的专项安全训练,产品层面则涵盖智能体沙箱与可配置网络访问。
OpenAI 发布 GPT-5.1-Codex-Max,一款面向 Codex 的更快、更智能的智能体编码模型。该模型面向长时间、项目级任务设计,具备更强的推理能力和 token 效率。
推荐理由:OpenAI 发布面向 Codex 的智能体编码模型,读者可了解其在长时任务与 token 效率上的定位。
Google DeepMind 发布 Gemini 3 Pro,称其在各项主要 AI 基准上超过此前版本,编码能力超过 2.5 Pro,可接入现有智能体与编码工作流。
推荐理由:Gemini 3 Pro 的基准成绩、定价与配套工具同时公布,读者可据此判断它能否接入现有编码与智能体工作流。
Google DeepMind 发布 Gemini 3,首发 Gemini 3 Pro 预览版,同步上线 Gemini app、Search 的 AI Mode、AI Studio、Vertex AI、Gemini CLI 及新智能体开发平台 Google Antigravity。
推荐理由:官方给出 Gemini 3 Pro 在推理、多模态与编码基准上的具体分数和上线渠道,可据此判断能力代际变化。
Google 发布智能体开发平台 Google Antigravity,即日起公开预览且免费,Gemini 3 Pro 使用有较宽松的速率限制。该平台在 AI IDE 的 Editor 视图之外新增智能体优先的 Manager 视图,可并行编排多个工作区中的智能体,并支持浏览器控制、异步交互与 Artifacts 交付物。
推荐理由:Google 官方给出 Antigravity 的四个设计原则与公开预览入口,可据此判断智能体优先 IDE 的形态变化。
Google 发布生成式 UI 实现,由模型针对任意提示词自动设计并编码出网页、游戏、工具等交互界面,论文题为 Generative UI: LLMs are Effective UI Generators。
推荐理由:Google 官方给出生成式 UI 的实现路径与人类偏好评测结果,可据此判断界面生成这一方向的成熟度。
Google DeepMind 发布 SIMA 2,通过将 Gemini 模型嵌入智能体核心,使其从指令执行者升级为可推理目标、与用户对话并自我改进的交互式游戏伙伴。
推荐理由:SIMA 2 把 Gemini 的推理能力接入 3D 游戏智能体,读者可了解其在泛化与自我改进上的具体进展与当前限制。
OpenAI 在 ChatGPT 中推出群聊功能,让多人可以和 ChatGPT 在同一个对话里协作。官方给出的说明是,用户能与其他人和 ChatGPT 一起在同一段对话中协同。
Google 推出数据科学智能体 DS-STAR,通过数据文件分析、LLM 评判验证与顺序规划迭代三项创新,在 DABStep、KramaBench、DA-Code 上超越 AutoGen 和 DA-Agent,准确率分别从 41.0% 提升至 45.2%、39.8% 提升至 44.7%、37.0% 提升至 38.5%。
Chime CMO Vineet Mehra 分享了 AI 如何将营销重塑为智能体驱动的模式。他认为,优先提升 AI 素养并审慎采用 AI 的领导者将推动增长。
OpenAI 推出 Aardvark,一个 AI 驱动的安全研究员,可自主大规模发现、验证并协助修复软件漏洞。该系统目前处于私有测试阶段,可通过报名参与早期测试。
MiniMax 披露 M2 后训练中的智能体对齐经验:智能体需要交错思考(Interleaved Thinking),在任务全程而非开头一次性推理,以应对长上下文和工具输出带来的扰动。
OpenAI 发文详解其 ChatGPT 浏览器 Atlas 背后的新架构 OWL。该架构将 Chromium 解耦,实现快速启动、丰富 UI 以及 ChatGPT 驱动的智能体式浏览。
推荐理由:OpenAI 官方拆解 ChatGPT Atlas 浏览器背后的 OWL 架构,读者可了解其如何解耦 Chromium 并支撑智能体式浏览。
Google Research 在 UIST'25 发布 StreetReaderAI,一个基于 Gemini 的街景无障碍原型,通过 AI Describer 和 AI Chat 两个子系统为盲人及低视力用户实时生成街景语音描述并支持对话式提问。
Google 公布基于 Gemini 模型的个人健康教练构建方案,采用多智能体框架协调对话智能体、数据科学智能体和健身等领域的专家子智能体,对睡眠、活动等生理时间序列数据做数值推理并给出个性化建议。
推荐理由:Google 公开了健康教练的多智能体架构与 SHARP 评估框架,可了解 Gemini 在健康场景的落地方式。