Google DeepMind 发布 Gemini 3 Pro,并推出智能体开发平台 Google Antigravity
Google DeepMind 发布 Gemini 3 Pro,称其在各项主要 AI 基准上超过此前版本,编码能力超过 2.5 Pro,可接入现有智能体与编码工作流。
推荐理由:Gemini 3 Pro 的基准成绩、定价与配套工具同时公布,读者可据此判断它能否接入现有编码与智能体工作流。
AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。
Google DeepMind 发布 Gemini 3 Pro,称其在各项主要 AI 基准上超过此前版本,编码能力超过 2.5 Pro,可接入现有智能体与编码工作流。
推荐理由:Gemini 3 Pro 的基准成绩、定价与配套工具同时公布,读者可据此判断它能否接入现有编码与智能体工作流。
Google 发布智能体开发平台 Google Antigravity,即日起公开预览且免费,Gemini 3 Pro 使用有较宽松的速率限制。该平台在 AI IDE 的 Editor 视图之外新增智能体优先的 Manager 视图,可并行编排多个工作区中的智能体,并支持浏览器控制、异步交互与 Artifacts 交付物。
推荐理由:Google 官方给出 Antigravity 的四个设计原则与公开预览入口,可据此判断智能体优先 IDE 的形态变化。
OpenAI 在 API 中上线 GPT-5.1,带来更快的自适应推理、扩展的提示词缓存和改进的编码表现。该版本还新增 apply_patch 和 shell 工具。
推荐理由:GPT-5.1 在 API 上线,给出推理速度、缓存与编码能力变化,开发者可据此评估迁移。
OpenAI Codex 现已正式可用(generally available),面向开发者新增多项功能。新功能包括 Slack 集成、Codex SDK,以及用量看板和工作区管理等管理工具,官方称这些更新让 Codex 更易使用、更便于规模化管理和使用。
推荐理由:Codex 从预览走向正式可用,并补齐 Slack 集成、SDK 与管理后台,读者可据此判断团队规模化使用的门槛变化。
OpenAI 宣布升级 Codex,使其更快、更可靠,并更擅长实时协作和独立处理任务。升级后的 Codex 可在终端、IDE、网页乃至手机上使用。
推荐理由:Codex 在速度、可靠性和实时协作上的升级,读者可据此判断终端、IDE、网页与手机端编码体验的变化。
OpenAI 发布 GPT-5 系统卡增补,介绍新模型 GPT-5-Codex,这是 GPT-5 针对 Codex 中智能体编码进一步优化的版本。GPT-5-Codex 会根据任务复杂度更动态地调整思考投入,对简单对话查询或小任务快速响应,对更复杂任务则独立工作更长时间。
推荐理由:GPT-5 系统卡增补披露了面向 Codex 智能体编码优化的 GPT-5-Codex,可了解其动态思考机制。
OpenAI 在 API 平台推出 GPT-5,主打高推理性能、面向开发者的新控制项,以及在真实编码任务上的领先结果。
推荐理由:OpenAI 在 API 平台上线 GPT-5,开发者可据此了解新模型在推理与真实编码任务上的定位。
OpenAI 发布内容介绍如何用 GPT-5 进行编码与设计,称其在编码和设计上带来新的可能性。原文仅提供摘要,未给出具体功能、示例或数据。
Mistral 发布 Codestral 25.08,并推出覆盖补全、语义检索与智能体工作流的企业级编码栈。Codestral 25.08 相比此前版本接受的补全增加 30%,建议后保留代码增加 10%,失控生成减少 50%。
推荐理由:原文给出 Codestral 25.08 的补全提升数据与整套企业编码栈的部署方式,读者可据此判断私有化落地的可行路径。
Mistral AI 与 All Hands AI 合作发布 Devstral Medium,并升级 Devstral Small 1.1。
推荐理由:Mistral 与 All Hands AI 合作发布两款编码智能体模型,读者可据此了解开源编码模型在 SWE-Bench Verified 上的最新位置与定价。
Mistral 发布企业级 AI 编码助手 Mistral Code,将模型、IDE 插件、本地部署选项和企业工具打包为一体化方案,基于开源项目 Continue 构建,今日面向 JetBrains IDE 和 VSCode 开放私测,正式版计划随后推出。
推荐理由:Mistral 把编码模型、IDE 插件与企业管控打包成可本地部署的方案,读者可据此判断企业级编码助手的落地路径。
Mistral AI 与 All Hands AI 合作发布面向软件工程任务的智能体 LLM Devstral,以 Apache 2.0 许可开源。
推荐理由:官方给出 Devstral 在 SWE-Bench Verified 的分数与开源许可,读者可据此判断它能否用于本地或企业代码智能体。
OpenAI 发布 Codex。原文正文未能抓取,仅标题可用。
Mistral AI 发布 Mistral Medium 3,定位兼顾 SOTA 性能与更低成本,定价为每百万 token 输入 0.4 美元、输出 2 美元。
推荐理由:官方给出 Mistral Medium 3 的定价、对标模型与部署门槛,便于判断企业自部署的性价比。
OpenAI 在 API 中推出 GPT-4.1 系列模型,官方称其在编码、指令遵循和长上下文理解上全面提升,并同步发布首个 nano 模型,即日起面向全球开发者开放。
推荐理由:OpenAI 在 API 上线 GPT-4.1 系列,并首次推出 nano 版本,可据此了解新模型在编码与长上下文上的能力定位。
Mistral AI 发布 Codestral 25.01,采用更高效的架构和改进的 tokenizer,生成与补全代码速度约为原版 Codestral 的 2 倍,上下文长度从 32k 提升到 256k。
推荐理由:官方给出 Codestral 25.01 的架构与 tokenizer 变化、256k 上下文和多项基准对比,可据此判断它在代码补全场景的位置。
OpenAI 发布 SWE-bench 的人工校验子集 SWE-bench Verified,用于更可靠地评估 AI 模型解决真实软件问题的能力。
推荐理由:OpenAI 发布经人工校验的 SWE-bench 子集,可用于比较模型解决真实软件问题的能力。
Mistral AI 发布 Mistral Large 2,参数规模 123B,支持 128k 上下文窗口和数十种语言,可在单节点上以较大吞吐运行。官方称其在 MMLU 上准确率达 84.0%,代码与推理表现与 GPT-4o、Claude 3 Opus、Llama 3 405B 相当,并针对减少幻觉和遵循精确指令做了训练。
推荐理由:原文给出 123B 参数、128k 上下文与多项基准对比,可据此判断单节点部署的成本与能力边界。
Mistral AI 发布 Codestral Mamba,这是一个基于 Mamba 架构的代码模型,具备线性时间推理能力,权重以 Apache 2.0 许可开放下载。
推荐理由:Mamba 架构在代码场景的落地样本,线性时间推理与 256k token 检索测试给出了与 Transformer 路线对比的具体参照。
Mistral AI 发布首个代码模型 Codestral,这是一个 22B 的开源权重生成式模型,专门面向代码生成任务,支持 80+ 编程语言,包括 Python、Java、C、C++、JavaScript 和 Bash。
推荐理由:Mistral 首个代码模型给出了 22B 参数、32k 上下文与多语言基准对比,可据此判断其代码补全定位。