LegalOn 将 Codex 成本削减一半并保持开发速度
LegalOn 将 Codex 预估每日成本削减 65%,同时保持开发速度不变。该公司通过将任务匹配给 Astra、Sol 和 Luna,并进行预算策略管理来实现这一目标。
LegalOn 将 Codex 预估每日成本削减 65%,同时保持开发速度不变。该公司通过将任务匹配给 Astra、Sol 和 Luna,并进行预算策略管理来实现这一目标。
Oracle 借助 ChatGPT Work 和 Codex,把招聘、工程和运营中的专业知识转化为快速、可复用的工作流,将原本数天的工作压缩到几分钟。该方案覆盖招聘、工程和运营等多个部门。
GitHub 发布与 Microsoft Applied Sciences 合作微调的 ModernBERT 密钥分类器,能在 2 毫秒内评估一批候选密钥,使可拦截的密钥数量翻倍以上。
推荐理由:原文用九个季度数据拆解了泄露密钥随代码量增长的成因,并给出新模型如何在推送环节拦截,读者可据此理解平台侧防护的思路转变。
NVIDIA 官方博客称,基于 Nemotron 3 用 SFT、RL 与反馈式推理特化的系统在 IOI 2026 与 IMO 2026 均达金牌水平:Nemotron-3-Ultra-CC 得 535.4/600,超过 361.12 的金牌线与人类最高分 498.27;IMO 系统得 30/42,超过官方金牌线 29。
推荐理由:原文给出从基座到数据再到推理循环的四步特化配方,读者可据此评估复现金牌级系统的成本与路径。
Mistral AI 宣布 Mistral Large 4(非正式代号 le Chonk)进入公开预览,可在 Mistral Studio 使用预览 API,权重将于本月底发布。
推荐理由:原文给出参数规模、开放权重时间表和多组基准成绩,读者可据此评估其与现有开源模型的差距。
Z.ai(智谱 AI)的 GLM 5.3 现已上线 Amazon Bedrock,这是一款 753B 参数 MoE 模型,面向编码与长程智能体任务,可通过全托管 API 使用,支持跨区域推理、prompt caching 和服务层级。
推荐理由:原文给出接入方式、缓存配置和完整实测流程,可直接照做部署与成本优化。
AWS 发布教程,介绍如何在 AWS GovCloud (US) 的 Amazon Bedrock 上使用 Claude Code 支撑带合规要求的工作负载。
GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放基准,研究预览版现已上线。
GitHub 提出 AI 时代开发者应强化的三项技能:学会指挥 AI 智能体而非仅使用它、不轻信 AI 的首次回答、用 AI 节省的时间去解决更大的问题。文中以 GitHub Copilot 内置的 Rubber Duck agent 为例,说明它用第二个模型对计划、代码和测试进行批判性审查,以发现首个模型遗漏的问题。
Chatham Financial 借助 OpenAI 的 Codex 和 GPT-5.6 构建技术并重构工作流,将交易验证时间从 30 分钟缩短到 4 分钟以内。该举措用于扩展其在资本市场领域的专业能力。
GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,面向智能体编码、计算机使用和专业工作负载提供更强的推理能力。据 OpenAI 称,它在 DeepSWE v1.1 上达到 GPT-6 Astra 的水平,每任务成本约为其五分之一,并比 GPT-6 Sol 的最佳成绩高出 6.4 个百分点。
推荐理由:原文给出 GPT-6.1 Sol 在 Bedrock 上的可用范围与成本对比,读者可据此判断智能体编码任务的性价比。
OpenAI 发布 GPT-6.1 Sol,官方称其具备接近 Astra 的智能水平,面向编码、电脑操作和专业工作场景。该模型标准 API 输入与输出 token 价格均为 Astra 的五分之一。
推荐理由:OpenAI 公布 GPT-6.1 Sol 的定位与定价,读者可据此比较它与 Astra 在编码和电脑操作上的取舍。
OpenAI 正在为 Codex Originals 项目征集使用 Codex 的开发者、研究者与创作者的真实故事,入选者将参与该项目的下一阶段。感兴趣者可通过官方渠道提交自己的故事与项目介绍。
Proaction 使用 Codex、GPT-Live-1 和 GPT-6 Astra 构建、运营并销售现代车队管理方案,销售提升 60%,节省 75+ 小时。
GitHub Podcast 最新一期逐条拆解了五个 AI 热梗:AI 生成的代码仍需人来负责,只是审查力度应按风险分级;Skills 与 MCP 解决的是不同问题,前者是打包好的经验,后者是连接工具与数据的标准;RAG 并未消亡,它让模型从训练数据之外获取文档、内部知识和代码库上下文,检索不佳会浪费 token、拖慢速度并增加答案不完整的概率。
GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,AI 智能体编写了大部分代码,跨 128 个 PR 增量落地,性能提升数个数量级。
推荐理由:GitHub 工程师复盘用 Copilot 把运行时从 TypeScript 迁到 Rust 的全过程,含提示缓存、子智能体分工等可迁移的工程经验。
Cognition 用 GPT-6 Astra 提升 Devin 测试软件并证明其可用的能力,目标是让工程师少审代码、多交付。
GitHub Copilot 应用内置 diff、终端和浏览器三个面板,让开发者无需在编辑器、终端窗口和浏览器之间来回切换,即可完成审查、运行和预览 AI 生成代码的完整闭环。
Mistral 帮助一家欧洲能源运营商将 4 万行 Fortran 77 迁移至 C++,对象是一个无测试套件、无集中文档的物理密集型油藏模拟器。团队先构建数值一致性校验框架,再用 Vibe CLI 调度上百个智能体解析调用树并生成文档,最终采用人工介入的 coder、tester、reviewer 智能体工作流逐模块迁移。
MIT 研究人员使用 GPT-5.6 Sol 配合 Codex 自主运行量子计算实验、分析结果并校准量子比特。
1Password 的工程师使用 Codex 快速构建新功能和内部工具,在维持严格安全策略的同时达到生产就绪状态,工程效率提升 21%。
OpenAI 内部编程智能体正在重塑 AI 研究方式。OpenAI 分享了智能体使用情况、实验速度、任务复杂度与研究加速方面的早期数据。
GitHub 发布 Project HydraFusion 研究预览,在运行时通过多模型编排完成任务,已面向所有 GitHub Copilot 套餐开放,可在 GitHub Copilot CLI 中通过 /experimental 启用。
推荐理由:GitHub 官方披露 HydraFusion 的三种编排模式与三套基准的成本质量对比,可据此判断多模型编排在编码任务上的取舍。
Playco 借助 GPT-6 Astra,从同一灰盒基础构建了三款主题游戏原型,人工修复量比使用上一代模型减少 50%。
OpenAI 发布 GPT-6 Astra,称其为目前最智能、对齐程度最高的模型。官方表示该模型在计算机操作、编码、网络安全和科学领域具备 SOTA 能力。
推荐理由:OpenAI 官方公布 GPT-6 Astra 的发布信息,读者可据此了解新模型在计算机操作、编码等方向的能力定位。
Google DeepMind 发布 Gemini 3.8,包含通用模型 Gemini 3.8 Flash 和网络安全模型 Gemini 3.8 Flash Cyber,定价与 3.7 Flash 相同,为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。
推荐理由:官方给出 3.8 Flash 与 Cyber 两个变体的基准成绩、定价和开放入口,可据此判断长程编码与漏洞修复的可用性。
Polimill 正基于 OpenAI 的 GPT 模型和 Codex 构建日本下一代公共 AI 基础设施,帮助地方政府检索和使用行政知识,同时加快开发进度。
loveholidays 借助 OpenAI Codex 让公司各团队都能参与软件开发,把想法更快变成产品。该案例展示了 Codex 如何降低开发门槛,使非工程岗位也能动手构建。
Multiverse Computing 发布论文《Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs》,提出 QAH 方法:在结构压缩并量化后,直接从压缩前的原始模型蒸馏,而非从恢复出的 bfloat16 检查点蒸馏。
推荐理由:论文给出压缩加量化后从原始模型蒸馏的恢复配方,并附9项基准对比与QAT稳定性差异。
GPT-5.6 现已在 Kiro 中可用,帮助开发者完成软件的规划、构建、审查与测试,并带来更好的性价比。
Stampli 借助 Codex 和 ChatGPT Work,把原本需要数周的发布物料制作压缩到几天,发布工时减少 68%。在截止日期固定、设计资源被占用的情况下,该公司用这套组合完成了上线生产。
Asana 借助 OpenAI Codex 在两周内替换了陈旧的测试系统,模型与基础设施成本约 1.2 万美元。这项原本预计耗时数年的代码迁移由此大幅提速。
Google DeepMind 发布 Gemini 3.7 Flash,称其为面向编码和智能体最强的主力模型,距 Gemini 3.6 Flash 发布仅三周。
推荐理由:官方给出 3.7 Flash 在编码、文档与业务工作流上的基准对比和限时定价,可据此评估升级与成本。
OpenAI 发布一份实地报告,展示科学家如何用 AI 编程智能体推进科学计算现代化,加快软件开发与发现,覆盖基因组学等领域。
NTT DATA Group 借助 ChatGPT Enterprise 和 Codex,帮助 9,000 名员工实现工作自动化,并将事件分析时间缩短至 30 分钟。该集团同时借此推进安全可控的 AI 规模化落地。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和面向网络安全的 3.5 Flash Cyber 三款新模型。
推荐理由:官方给出三款 Flash 新模型的定价、基准与开放入口,可据此判断智能体工作流的成本与延迟取舍。
OpenAI 创意团队借助 Codex 构建定制创意工具,加速创意构思并更快完成原型开发。Codex 作为具备上下文感知能力的 AI,已成为该团队的协作伙伴。
OpenAI 发布新分析,指出流行编码基准 SWE-Bench Pro 存在可靠性与准确性方面的问题。该分析揭示了这一用于评估 AI 模型的基准在评测中可能产生误导性结果。
Australian Payments Plus 使用 ChatGPT Enterprise 和 Codex 应对支付业务的复杂性,实现节省时间、提升质量,同时保留人工判断。
Hugging Face 发布开源基准 ScarfBench,用于评估 AI 智能体在企业级 Java 框架迁移中的表现,覆盖 Spring、Jakarta EE、Quarkus 三大生态,含 34 个应用、102 个框架实现、204 个迁移任务和 1331 个专家测试。