OpenAI 推出 Codex Labs,联合埃森哲、普华永道等推动企业部署
OpenAI 推出 Codex Labs,并与 Accenture、PwC、Infosys 等合作,帮助企业在软件开发生命周期中部署和扩展 Codex。OpenAI 同时公布 Codex 周活跃用户达到 4M。
推荐理由:OpenAI 公布 Codex 的企业落地路径与 4M 周活数据,可观察编码智能体在大型组织中的采用方式。
OpenAI 推出 Codex Labs,并与 Accenture、PwC、Infosys 等合作,帮助企业在软件开发生命周期中部署和扩展 Codex。OpenAI 同时公布 Codex 周活跃用户达到 4M。
推荐理由:OpenAI 公布 Codex 的企业落地路径与 4M 周活数据,可观察编码智能体在大型组织中的采用方式。
OpenAI 更新 macOS 和 Windows 版 Codex 应用,新增 computer use、应用内浏览、图像生成、记忆和插件功能,用于加速开发者工作流。
推荐理由:原文列出 Codex 桌面端新增的几项能力,读者可据此判断它覆盖了哪些开发环节。
CyberAgent 借助 ChatGPT Enterprise 和 Codex 在广告、媒体与游戏业务中安全扩大 AI 应用,提升质量并加快决策。该案例由 OpenAI 发布,重点在于企业级安全部署与跨业务线的规模化落地。
OpenAI 为 Codex 在 ChatGPT Business 和 Enterprise 中新增按用量付费(pay-as-you-go)定价,让团队能更灵活地启动和扩展使用。
OpenAI 采用链式思维监控(chain-of-thought monitoring)研究内部编码智能体的失准问题,通过分析真实部署环境来检测风险并强化 AI 安全保障措施。
OpenAI 宣布将收购 Astral,以加速 Codex 的增长,并用于打造新一代 Python 开发工具。官方未在摘要中披露交易金额、时间表等具体条款。
OpenAI 发布 GPT-5.4 mini 和 nano,是 GPT-5.4 更小、更快的版本,针对编码、工具调用、多模态推理以及高并发 API 和子智能体负载做了优化。
推荐理由:OpenAI 公布 GPT-5.4 的小型版本,读者可据此了解其在编码、工具调用与高并发场景中的定位。
Codex Security 不依赖传统 SAST,而是用 AI 驱动的约束推理与验证来发现真实漏洞,减少误报。该文深入解析了这一设计取舍的原因。
Mistral 基于其开源编码助手 Vibe 构建了一个自主智能体,可读取 Rails 源文件、生成或改进 RSpec 测试,并在 CI/CD 流水线中无需人工干预地并行运行。通过仓库级 AGENTS.md 执行计划和按文件类型划分的 SKILLS 文件,其质量评分从 0.68 提升至 0.74。
OpenAI 发布 GPT-5.4,称其为面向专业工作场景的前沿模型,具备编码、计算机操作、工具搜索能力和 1M token 上下文。OpenAI 表示这是其能力最强、效率最高的前沿模型。
推荐理由:OpenAI 公布 GPT-5.4 的编码、计算机操作与 1M token 上下文等能力定位,可据此判断前沿模型的迭代方向。
OpenAI 与太平洋西北国家实验室联合推出 DraftNEPABench,用于评估 AI 编程智能体加速联邦许可审批的能力,显示有望将 NEPA 起草时间最多缩短 15%。该基准旨在推动基础设施审查流程的现代化。
OpenAI 与 Figma 推出 Codex 集成,打通代码与设计,让团队在实现与 Figma 画布之间来回切换,加快迭代与交付。
OpenAI 宣布不再使用 SWE-bench Verified 评测前沿编码能力,原因是该基准日益受到污染,存在测试缺陷与训练数据泄漏问题。其分析指出,这些问题导致 SWE-bench Verified 无法准确衡量编码进展,因此建议改用 SWE-bench Pro。
OpenAI 发布 GPT-5.3-Codex-Spark,称其为首个实时编码模型,生成速度提升 15x,上下文窗口为 128k。该模型目前面向 ChatGPT Pro 用户开放研究预览。
推荐理由:OpenAI 公布首个实时编码模型的生成速度与上下文规格,可据此了解编码模型在低延迟方向上的进展。
OpenAI 技术人员 Ryan Lopopolo 提出 Harness engineering,探讨在智能体优先的世界中如何利用 Codex。文章聚焦于围绕 Codex 构建工程化支撑体系,以适应以 AI 智能体为核心的开发范式。
OpenAI 发布 GPT-5.3-Codex,这是一个 Codex 原生的智能体,将前沿编码能力与通用推理结合,用于支持长周期、真实世界的技术工作。
推荐理由:OpenAI 发布 Codex 原生的 GPT-5.3-Codex,读者可据此了解其编码能力与通用推理结合后的定位。
OpenAI 发布 GPT-5.3-Codex 系统卡,称其为目前能力最强的智能体编码模型。该模型结合了 GPT-5.2-Codex 的前沿编码性能与 GPT-5.2 的推理和专业领域知识能力。
推荐理由:官方系统卡给出 GPT-5.3-Codex 的能力定位,读者可据此了解它在编码与推理上的组合方式。
OpenAI 介绍 Codex App Server,这是一个双向 JSON-RPC API,用于把 Codex 智能体嵌入到应用中。该接口支持流式进度、工具调用、审批和 diff 等能力。
OpenAI 发布面向 macOS 的 Codex app,定位为 AI 编码与软件开发的指挥中心,支持多个智能体、并行工作流和长时间运行的任务。
推荐理由:官方给出 Codex app 的定位与多智能体、并行工作流等能力,读者可据此判断 AI 编码工具形态的变化。
Mistral 发布终端编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型系列驱动,新增自定义子智能体、多选项澄清、斜杠命令技能和统一智能体模式,CLI 修复持续自动更新。
推荐理由:官方给出 Vibe 2.0 的自定义子智能体、斜杠命令技能与定价变化,可据此判断终端编码智能体的使用成本与工作流。
OpenAI 技术解析 Codex 智能体循环,说明 Codex CLI 如何借助 Responses API 编排模型、工具、提示词与性能。
OpenAI 详细介绍了其内部团队如何使用 Codex 来理解代码、重构系统、提升性能、加快开发速度并优化工程工作流。Codex 作为 OpenAI 的编程工具,被应用于代码理解、系统重构、性能优化等多个环节,以提升整体工程效率。
Datadog 使用 OpenAI 的 Codex 进行系统级代码审查。该实践将 Codex 应用于系统层面的代码审查工作。
OpenAI 发布 GPT-5.2-Codex,称其为自家最先进的编码模型。该模型主打长程推理、大规模代码转换和增强的网络安全能力。
推荐理由:OpenAI 官方给出 GPT-5.2-Codex 的定位与三项能力方向,可据此了解其编码模型的最新迭代重点。
OpenAI 发布 GPT-5.2 System Card 的增补内容,涉及 GPT-5.2-Codex。原文正文抓取失败,仅标题可用。
Google DeepMind 发布 Gemini 3 Flash,将 Gemini 3 的推理能力与 Flash 级延迟、效率和成本结合,定价为 $0.50/1M 输入 tokens、$3/1M 输出 tokens。
推荐理由:官方给出 Gemini 3 Flash 的基准分数、定价与上线渠道,读者可据此判断它在速度与成本上的取舍。
OpenAI 借助 Codex 在 28 天内完成 Android 版 Sora 的交付,AI 辅助的规划、翻译与并行编码工作流帮助一支精简团队实现了快速且可靠的开发。
OpenAI 发布 GPT-5.2,称其为面向日常专业工作最先进的前沿模型,具备最先进的推理、长上下文理解、编码和视觉能力。该模型可在 ChatGPT 和 OpenAI API 中使用,用于支撑更快、更可靠的智能体工作流。
推荐理由:OpenAI 公布 GPT-5.2 在推理、长上下文、编码与视觉上的定位,读者可据此判断日常专业工作与智能体流程的升级方向。
Mistral AI 发布新一代编码模型家族 Devstral 2,包含 123B 的 Devstral 2 和 24B 的 Devstral Small 2,两者均为开源模型,分别采用修改版 MIT 和 Apache 2.0 许可。
推荐理由:官方给出两款开源编码模型的参数、许可与 SWE-bench 成绩,并附与闭源模型的对比,便于判断开源编码模型的当前水位。
JetBrains 正在将 GPT-5 集成到其编码工具中,帮助开发者更快地设计、推理和构建软件。该集成面向数百万开发者,具体工具范围与上线细节尚未在材料中说明。
推荐理由:JetBrains 将 GPT-5 接入旗下编码工具,读者可据此了解主流 IDE 厂商在编码助手上的模型选型。
OpenAI 发布了一场关于 Codex 在软件开发生命周期各阶段应用的网络研讨会。研讨会聚焦于如何将 Codex 融入从规划到交付的完整开发流程,帮助团队在实际工程环节中使用 Codex。
OpenAI 发布 GPT-5.1-Codex-Max 系统卡,详述该模型的安全措施。模型层面包括针对有害任务和提示词注入的专项安全训练,产品层面则涵盖智能体沙箱与可配置网络访问。
OpenAI 发布 GPT-5.1-Codex-Max,一款面向 Codex 的更快、更智能的智能体编码模型。该模型面向长时间、项目级任务设计,具备更强的推理能力和 token 效率。
推荐理由:OpenAI 发布面向 Codex 的智能体编码模型,读者可了解其在长时任务与 token 效率上的定位。
Google DeepMind 发布 Gemini 3 Pro,称其在各项主要 AI 基准上超过此前版本,编码能力超过 2.5 Pro,可接入现有智能体与编码工作流。
推荐理由:Gemini 3 Pro 的基准成绩、定价与配套工具同时公布,读者可据此判断它能否接入现有编码与智能体工作流。
Google 发布智能体开发平台 Google Antigravity,即日起公开预览且免费,Gemini 3 Pro 使用有较宽松的速率限制。该平台在 AI IDE 的 Editor 视图之外新增智能体优先的 Manager 视图,可并行编排多个工作区中的智能体,并支持浏览器控制、异步交互与 Artifacts 交付物。
推荐理由:Google 官方给出 Antigravity 的四个设计原则与公开预览入口,可据此判断智能体优先 IDE 的形态变化。
OpenAI 在 API 中上线 GPT-5.1,带来更快的自适应推理、扩展的提示词缓存和改进的编码表现。该版本还新增 apply_patch 和 shell 工具。
推荐理由:GPT-5.1 在 API 上线,给出推理速度、缓存与编码能力变化,开发者可据此评估迁移。
Hugging Face 发布 BigCodeArena,这是首个通过实际执行来评估代码生成模型的人类参与平台,支持 10 种语言和 8 种执行环境,可实时运行模型生成的代码并投票对比。平台自 2025 年 2 月上线以来已收集超 14,000 次对话、500 多名用户和 4,700+ 偏好投票,o3-mini 与 o1-mini 在 Elo 排名中持续领先。
OpenAI Codex 现已正式可用(generally available),面向开发者新增多项功能。新功能包括 Slack 集成、Codex SDK,以及用量看板和工作区管理等管理工具,官方称这些更新让 Codex 更易使用、更便于规模化管理和使用。
推荐理由:Codex 从预览走向正式可用,并补齐 Slack 集成、SDK 与管理后台,读者可据此判断团队规模化使用的门槛变化。
Hugging Face 博客发布 VibeGame,一个基于 three.js、rapier 和 bitecs 构建的高层声明式游戏引擎,专为 AI 辅助游戏开发设计。
OpenAI 宣布升级 Codex,使其更快、更可靠,并更擅长实时协作和独立处理任务。升级后的 Codex 可在终端、IDE、网页乃至手机上使用。
推荐理由:Codex 在速度、可靠性和实时协作上的升级,读者可据此判断终端、IDE、网页与手机端编码体验的变化。