OpenAI 为何不再评测 SWE-bench Verified
OpenAI 宣布不再使用 SWE-bench Verified 评测前沿编码能力,原因是该基准日益受到污染,存在测试缺陷与训练数据泄漏问题。其分析指出,这些问题导致 SWE-bench Verified 无法准确衡量编码进展,因此建议改用 SWE-bench Pro。
OpenAI 宣布不再使用 SWE-bench Verified 评测前沿编码能力,原因是该基准日益受到污染,存在测试缺陷与训练数据泄漏问题。其分析指出,这些问题导致 SWE-bench Verified 无法准确衡量编码进展,因此建议改用 SWE-bench Pro。
OpenAI 宣布推出 Frontier Alliance Partners,帮助企业从 AI 试点走向生产环境,实现安全、可扩展的智能体部署。
OpenAI 分享了其 AI 模型针对 First Proof 数学挑战的证明尝试,用于测试模型在专家级问题上的研究级推理能力。
OpenAI 承诺向 The Alignment Project 投入 750 万美元,用于资助独立的 AI 对齐研究。该资金旨在加强全球应对 AGI 安全与安保风险的努力。
OpenAI 推出 OpenAI for India,在印度扩建本地基础设施、赋能企业并提升劳动力技能。该计划旨在扩大印度全国的 AI 可及性。
OpenAI 与 Paradigm 联合推出 EVMbench,用于评估 AI 智能体检测、修补和利用高危智能合约漏洞的能力。该基准聚焦高严重性漏洞的发现、修复与攻击三类任务。
OpenAI 发布新预印本,显示 GPT-5.2 为一个胶子振幅提出了新公式,随后由 OpenAI 与学术合作者正式证明并验证。该结果以预印本形式公开。
推荐理由:OpenAI 与学术合作者披露 GPT-5.2 提出胶子振幅新公式并被形式化证明,可观察大模型参与理论物理推导的路径。
OpenAI 在 ChatGPT 中推出 Lockdown Mode 和 Elevated Risk 标签,帮助组织防御提示词注入和 AI 驱动的数据外泄。
推荐理由:OpenAI 为 ChatGPT 新增 Lockdown Mode 与 Elevated Risk 标签,面向企业防御提示词注入和数据外泄。
OpenAI 发布开源工具包 GABRIEL,借助 GPT 把定性文本和图像转化为定量数据,帮助社会科学家大规模分析研究。该工具面向社会科学研究场景,可扩展处理规模。
OpenAI 构建了一套实时访问系统,将速率限制、用量追踪与 credits 结合,为 Codex 和 Sora 提供持续访问能力。该系统旨在突破单纯速率限制的局限,支撑这两个产品的规模化访问。
Hugging Face 发布 cuda-kernels Agent Skill,让 Claude、Codex 等编码智能体为 diffusers 和 transformers 项目编写生产级 CUDA 内核,并生成 PyTorch 绑定与基准脚本。
推荐理由:原文给出可安装的 CUDA 内核技能与完整基准数据,读者可据此判断智能体写内核的可行边界。
OpenAI 发布 GPT-5.3-Codex-Spark,称其为首个实时编码模型,生成速度提升 15x,上下文窗口为 128k。该模型目前面向 ChatGPT Pro 用户开放研究预览。
推荐理由:OpenAI 公布首个实时编码模型的生成速度与上下文规格,可据此了解编码模型在低延迟方向上的进展。
OpenAI 技术人员 Ryan Lopopolo 提出 Harness engineering,探讨在智能体优先的世界中如何利用 Codex。文章聚焦于围绕 Codex 构建工程化支撑体系,以适应以 AI 智能体为核心的开发范式。
OpenAI for Government 宣布在 GenAI.mil 上部署定制版 ChatGPT,为美国国防团队提供安全、注重安全的 AI 能力。
OpenAI 公布其 AI 本地化思路,让全球共享的前沿模型适配本地语言、法律与文化,同时不牺牲安全性。该方案强调在保持安全的前提下完成本地化适配。
OpenAI 的 GPT-5 与 Ginkgo Bioworks 的云端自动化结合组成自主实验室,通过闭环实验将无细胞蛋白质合成成本降低 40%。
OpenAI 推出 Trusted Access for Cyber,一个基于信任的框架,在扩大前沿网络安全能力访问权限的同时加强对滥用的防护。
OpenAI 发布企业平台 OpenAI Frontier,用于构建、部署和管理 AI 智能体。该平台提供共享上下文、入职引导、权限管理和治理能力。
推荐理由:OpenAI 面向企业推出智能体平台,给出共享上下文、权限与治理等能力方向,可供判断企业级 Agent 落地形态。
OpenAI 发布 GPT-5.3-Codex,这是一个 Codex 原生的智能体,将前沿编码能力与通用推理结合,用于支持长周期、真实世界的技术工作。
推荐理由:OpenAI 发布 Codex 原生的 GPT-5.3-Codex,读者可据此了解其编码能力与通用推理结合后的定位。
OpenAI 发布 GPT-5.3-Codex 系统卡,称其为目前能力最强的智能体编码模型。该模型结合了 GPT-5.2-Codex 的前沿编码性能与 GPT-5.2 的推理和专业领域知识能力。
推荐理由:官方系统卡给出 GPT-5.3-Codex 的能力定位,读者可据此了解它在编码与推理上的组合方式。
OpenAI 介绍 Codex App Server,这是一个双向 JSON-RPC API,用于把 Codex 智能体嵌入到应用中。该接口支持流式进度、工具调用、审批和 diff 等能力。
OpenAI 公布 Sora 信息流的设计理念,通过个性化推荐激发创意、促进连接,并借助家长控制和强力护栏保障体验安全。
Snowflake 与 OpenAI 达成 2 亿美元合作协议,把前沿智能引入企业数据,让 AI 智能体和洞察直接在 Snowflake 中运行。
OpenAI 发布面向 macOS 的 Codex app,定位为 AI 编码与软件开发的指挥中心,支持多个智能体、并行工作流和长时间运行的任务。
推荐理由:官方给出 Codex app 的定位与多智能体、并行工作流等能力,读者可据此判断 AI 编码工具形态的变化。
OpenAI 封禁了一批疑似中国来源的账号,这些账号利用 AI 研究美国人员、地点及社会工程学手法。
OpenAI 封禁了一批与此前未披露、疑似俄罗斯来源的“No Bell”行动相关的账号,该行动利用 AI 面向非洲受众生成批评美国及其盟友的内容。
OpenAI 封禁了与一项此前未报告的行动相关的账号,该行动被其命名为“Trolling Stone”。该行动利用 AI 生成关于一名据称俄罗斯邪教领袖在阿根廷被捕的评论。
OpenAI 封禁了一批利用 AI 支撑恋爱诈骗流程的账号,涉及触达、翻译、与受害者互动以及投资诈骗诱饵等环节。
OpenAI 封禁了一批与 Rybar 网络关联的账号,其中部分账号可能源自俄罗斯,它们利用 AI 在网站和社交平台上开展多语言影响活动。
OpenAI 封禁了一个与中国执法部门相关人员关联的账号,该账号利用 AI 策划影响力活动、骚扰和网络行动。
OpenAI 封禁了一批很可能来自柬埔寨的账号,这些账号用 AI 冒充追损服务、律所和执法机构,目标是被诈骗过的人。该行动被命名为 Operation “False Witness”。
OpenAI 封禁了一批很可能源自柬埔寨的账号,这些账号利用 AI 对印尼交友用户实施诈骗,包括翻译和互动。该行动代号 "Date Bait",相关账号借助 AI 完成诈骗触达。
OpenAI 构建了一个内部 AI 数据智能体,结合 GPT-5、Codex 和记忆能力对海量数据集进行推理,可在数分钟内给出可靠洞察。
OpenAI 宣布将于 2026 年 2 月 13 日在 ChatGPT 中退役 GPT-4o、GPT-4.1、GPT-4.1 mini 和 OpenAI o4-mini,与此前已公布的 GPT-5(Instant、Thinking 和 Pro)退役同步进行。API 目前没有变化。
推荐理由:OpenAI 公布 ChatGPT 中多款旧模型的退役时间表,读者可据此安排现有应用的模型迁移。
大成建设人力资源团队正主导在全公司范围内部署 ChatGPT Enterprise,用于推动 AI 驱动的人才培养。
OpenAI 开放 EMEA Youth & Wellbeing Grant 申请,该项目总额 50 万欧元,用于资助非政府组织和研究人员,推进 AI 时代的青年安全与福祉。
OpenAI 发布欧盟经济蓝图 2.0,以新数据、合作伙伴关系和多项举措推动欧洲 AI 应用、技能与增长。
OpenAI 说明了 AI 智能体打开链接时保护用户数据的机制,通过内置防护防止基于 URL 的数据外泄和提示词注入。
Calvin Klein 与 Tommy Hilfiger 母公司 PVH Corp. 采用 ChatGPT Enterprise,将 AI 引入时装设计、供应链和消费者互动环节。
Hugging Face 博客复盘了用 verl 框架对 GPT-OSS 进行智能体强化学习训练时遇到的问题与修复。团队发现 GPT-OSS-20B 训练初期出现 KL 散度和熵爆炸、奖励不升,根因是 MoE 架构下双前向传播导致新旧 log-prob 不一致,使 PPO 的 importance sampling ratio 偏离 1;修复后该方案同样适用于 GPT-OSS-120B。