OpenAI 分析指出 SWE-Bench Pro 编码评测存在可靠性问题
OpenAI 发布新分析,指出流行编码基准 SWE-Bench Pro 存在可靠性与准确性方面的问题。该分析揭示了这一用于评估 AI 模型的基准在评测中可能产生误导性结果。
OpenAI 发布新分析,指出流行编码基准 SWE-Bench Pro 存在可靠性与准确性方面的问题。该分析揭示了这一用于评估 AI 模型的基准在评测中可能产生误导性结果。
OpenAI Academy 与 Walton Family Foundation 合作推出动手实践的 AI Skills Jams,帮助 K–12 教育工作者掌握课堂实用的 AI 技能。
OpenAI 发布新一代语音模型 GPT-Live,面向更自然的人机交互,目前已用于驱动 ChatGPT Voice。
推荐理由:OpenAI 发布新一代语音模型 GPT-Live,读者可了解它已接入 ChatGPT Voice 这一落地位置。
Australian Payments Plus 使用 ChatGPT Enterprise 和 Codex 应对支付业务的复杂性,实现节省时间、提升质量,同时保留人工判断。
三菱日联金融集团(MUFG)正借助 ChatGPT Enterprise 构建 AI 原生组织,以改进工作流程并规模化交付新的 AI 金融服务。
OpenAI Signals 新数据显示 ChatGPT 全球采用率持续增长,用户使用量增加、探索更多能力,并推动各地区和语言的增长。
OpenAI 发布 GeneBench-Pro,一个用复杂真实数据集测试 AI 在基因组学、生物学和科研中表现的新基准。该基准聚焦真实世界数据,而非简化任务。
OpenAI 工程师通过大规模 core dump 分析排查基础设施的罕见崩溃,同时发现了一处硬件故障和一个存在 18 年之久的软件 bug。
OpenAI 发布报告,梳理 AI 可能如何重塑欧盟各职业,指出哪些岗位面临自动化、增长或工作流程变化。报告聚焦欧盟劳动力市场,未披露具体职业清单或量化预测。
HP Inc. 与 OpenAI 启动 Frontier 战略合作,将 AI 部署到客户体验、软件开发和企业运营中。该合作在双方既有 OpenAI Frontier 伙伴关系基础上扩大规模。
OpenAI 预告下一代模型 GPT-5.6 Sol,在编码、科学和网络安全方面具备更强能力。该模型同时搭配 OpenAI 目前最先进的安全栈。
OpenAI 发布新研究论文,展示 AI 智能体正在改变工作方式,能够承担更长、更复杂的任务,并在各类岗位中提升生产力。
OpenAI 与 Broadcom 联合推出 Jalapeño,一款专为 LLM 推理打造的定制 AI 芯片。该芯片旨在提升 AI 系统在性能、能效与规模化方面的表现。
GPT-5 Pro 帮助免疫学家 Derya Unutmaz 破解了一个持续三年的免疫学难题,给出了关于 T 细胞行为的见解。这一进展可能为癌症和自身免疫研究提供支持。
推荐理由:原文交代了 GPT-5 Pro 在免疫学问题上的具体应用场景,读者可了解大模型参与科研推理的一种路径。
OpenAI 通过 Appia Foundation 支持先进 AI 的评估框架、安全实践与全球合作,推动共享标准建设。
Omio 正借助 OpenAI 构建对话式旅行体验,并推动自身转型为 AI 原生公司。该案例还展示了 Omio 如何用 OpenAI 加速产品开发。
牛津大学、英国AI Security Institute、斯坦福大学和伦敦政治经济学院的研究者通过四项实验、18,978场对话、6,923名参与者发现,AI系统在文本说服上稳定超过人类专家,即使专家提前研究、接受数小时结构化训练并获得1,000英镑奖金激励。
OpenAI 推出 Patch the Planet,这是 Daybreak 计划下的一项新举措,帮助开源维护者借助 AI 与专家审核发现、验证并修复漏洞。
OpenAI 推出新的 Daybreak 工具,包括 Codex Security 和 GPT-5.5-Cyber,帮助各类组织大规模发现、验证并修补漏洞。
推荐理由:OpenAI 推出面向安全场景的 Daybreak 工具,读者可了解其漏洞发现与修复的定位。
Jason Liu 分享了他使用 Codex 保存上下文、管理复杂项目的方法,让工作能够延续到单次提示词之外。该实践聚焦于长时间运行任务的上下文保持与项目管理。
Samsung Electronics 在全球员工中部署 ChatGPT Enterprise 和 Codex,成为 OpenAI 规模最大的企业 AI 落地项目之一。
Andrew Ng 在长文中指出,过去两周 Anthropic 和美国政府先后展示了控制前沿模型访问的权力:Anthropic 发布带额外护栏的 Claude Fable 5。
OpenAI 为 ChatGPT Enterprise 新增支出控制与用量分析功能,帮助企业管理成本并扩展 AI 应用。
OpenAI 用 GPT-5.5 Instant 改进 ChatGPT 的健康与养生回答,强化推理、上下文理解与表达清晰度,并引入医生参与设计的评估。该版本针对健康类问题优化,具体上线范围与参数未披露。
研究人员使用 OpenAI 的推理模型辅助诊断罕见疾病,在先前未解决的病例中识别出 18 例新诊断。
OpenAI 与 Molecule.one 展示了一个由 GPT-5.4 驱动的近自主 AI 化学家,它改进了一项关键的制药反应,推进了药物化学研究。
推荐理由:OpenAI 与 Molecule.one 用 GPT-5.4 驱动的近自主 AI 化学家改进药物合成反应,可了解 AI 在实验科学中的落地方式。
OpenAI 发布 LifeSciBench,一个由专家编写并评审的基准,用于评估 AI 系统处理真实生命科学研究任务与决策的能力。
OpenAI 推出 Deployment Simulation,一种在模型部署前用真实对话数据预测其行为的方法,旨在提升安全性与评估准确性。
OpenAI 推出 Partner Network,投入 1.5 亿美元帮助全球合作伙伴加速企业 AI 的采用、部署与转型。
OpenAI 推出三门 Academy 新课程,帮助人们建立实用 AI 技能、创建可复用工作流,并在日常工作中应用智能体。课程聚焦实际动手能力与可重复流程,面向下一阶段的工作方式。
Preply 借助 OpenAI 推出 AI 生成的课程总结,为语言学习提供个性化反馈与练习。该功能将 AI 与真人导师结合,用于个性化学习体验。
天体物理学家 Chi-kwan Chan 使用 OpenAI 的 Codex 构建黑洞模拟,帮助科学家研究极端物理并检验爱因斯坦的广义相对论。
OpenAI 宣布计划收购 Ona,以扩展 Codex 的安全、持久云环境能力,支持在企业工作流中长时间运行的 AI 智能体。
推荐理由:OpenAI 计划收购 Ona,读者可据此了解 Codex 在持久云环境与长时运行智能体上的布局方向。
OpenAI 宣布支持欧盟 AI 内容透明度实践准则,推进内容溯源标准与工具,帮助人们识别 AI 生成内容。该准则旨在确保可信的 AI 生态。
BBVA 与 OpenAI 合作,将 ChatGPT Enterprise 扩展至 10 万名员工,把 AI 置于银行业务核心。双方将共同推进全球 AI 驱动的银行转型。
OpenAI 模型与 Codex 现可通过 Oracle Cloud 访问,企业可使用已有的云承诺额度来构建和部署 AI。该方式支持企业级安全与治理。
OpenAI 发布新报告,称与中国相关的账号利用 AI 针对美国技术议题开展影响力操作。报告提到这些操作涉及数据中心相关叙事、关税以及关于 ChatGPT 的不实说法。
LSEG 借助 OpenAI 在全球业务中规模化可信 AI,加速洞察产出、缩短发布周期,并赋能 4000 名员工。
Nextdoor 工程师使用 Codex 搭配 GPT-5.5,用于排查难以复现的问题、跨平台构建,并聚焦产品结果。
Notion 借助 Codex 一次性生成规格说明、为网页端构建 AI Voice Input,并在小团队中放大工程产能。