OpenAI Agents API 本周更新:一次调用启动浏览器智能体、环境可跨会话复用
OpenAI Developers 公布 Agents API 本周更新:Computer use 支持用 1 次 API 调用启动浏览器加智能体,Bedrock Managed Agents 提供 AWS 上的 Agents API(除 GPT-6.1 Sol 外),并新增轻量或高配的 oai 托管环境规格。
OpenAI Developers 公布 Agents API 本周更新:Computer use 支持用 1 次 API 调用启动浏览器加智能体,Bedrock Managed Agents 提供 AWS 上的 Agents API(除 GPT-6.1 Sol 外),并新增轻量或高配的 oai 托管环境规格。
Replit 本周上线聊天内交互式图表,用户对 Replit Agent 说 "let's visualize this" 即可在对话中生成可视化。同时新增 GPT-6.1 Sol 和 Claude Sonnet 5.5 两个可选模型,前者擅长复杂任务,后者面向日常功能与修复,用户可在 Agent 中手动选择或保持 auto 模式。
OpenAI DevDay 笔记指出,构建智能体应用优化成本与性能的 4 个关键杠杆是 prompt caching、reasoning effort、programmatic tool calling 和 batch request。这些是 OpenAI 开发文档之外值得优先尝试的起点,建议熟悉后用 evals 进行测量。
Repovive 联合 IOI、IMO、ICPC 决赛选手评测 AI 判卷能力,从数学竞赛中选出 534 份可疑或边缘提交,建立统一评分标准与专家参考判断。模型整体偏严,更常拒绝有效提交;清晰指令让 GPT 模型平均提升约 2 个百分点,加入评分示例后 Claude 平均提升约 10 个百分点、GPT 约 5 个百分点。Grok 几乎拒绝一切,仅接受 1–5% 提交,而金标准接受 64.4%。
OpenAI DevDay 主舞台上介绍了 ChatGPT 插件扩展(plugin extensions),开发者可构建从 ChatGPT 侧边栏、侧边面板、自定义文件查看器与编辑器以及插件设置中打开的应用,完整规范见 github.com/openai/mcp-extensions。
Higgsfield 推出 AI Influencer,用户可创建自己的 AI 网红并将其带入任意热门趋势,由 Genjutsu 驱动。该功能现已在 Higgsfield 及 ChatGPT 扩展中上线,提供最多 5 次免费生成。
Higgsfield 发布 AI Influencer,用户可创建自己的 AI 网红并让其参与任意趋势,由 Genjutsu 提供支持。该功能在 Higgsfield 平台和 ChatGPT 扩展中均可使用,提供最多 5 次免费生成。
Arena 宣布 OpenAI 的 GPT-6.1 Sol (Max) 进入 Agent Arena 第 5 名,提升 11.23%,并重塑帕累托前沿。其单任务中位成本为 $0.56,比 GPT-6 Sol 低 39% 且得分高 1.52 分,比 GPT-6 Astra 低 81% 且得分差距 1.04 分。
推荐理由:Agent Arena 榜单显示 GPT-6.1 Sol 以更低单任务成本进入前五,读者可据此比较它与 GPT-6 Sol、Claude 系列的性价比差距。
据纽约时报报道,Anthropic 自 2025 年秋季起秘密邀请数十位宗教与哲学学者到办公室讨论 Claude 是否可能具有意识,参与者均需签署保密协议,联合创始人 Christopher Olah 将模型视为潜在有感知的存在,请嘉宾帮它做「道德教育」。
OpenAI 预告了由 GPT-6 Astra 驱动的 dots,定位为能力出众、始终在线的智能体,可处理各类任务。swyx 提醒外界不要忽略这一"one more thing",并称 OpenAI 在 dots 上已投入一段时间。
ChatGPT 的 Finances 功能开始向美国 Free 和 Go 用户推送,用户可通过 Plaid 和 Experian 安全连接账户,基于自己的财务信息获得回答。
ChatGPT 的 Finances 功能开始向美国 Free 和 Go 用户推送,用户可通过 Plaid 和 Experian 安全连接账户,基于自己的财务信息获得回答。
The Verge 记者 Allison Johnson 实测了 OpenAI 本周发布的智能体平台 Dots,它拥有拟人化头像和可自定义名称,界面与 Meta Muse 类似,可让智能体在虚拟机中操作 Blender、GIMP 等应用,并可通过桌面版 ChatGPT 应用访问用户自己的电脑。
TechCrunch Equity 播客本期讨论白宫 AI 安全承诺与"超级智能"行政令,以及消费级 AI 的经济账:只有 2% 消费者真正买单,AI 最大的钱仍来自企业市场。节目还谈及 Oura 撤回 IPO、Anthropic 泄露的 S-1、OpenAI 回归私募融资,以及 Quartermaster 1.4 亿美元融资、Atomic 已承接 DoorDash 90% 采购等交易。
白宫本周召集 Zuckerberg、Bezos、Musk、Anthropic 的 Dario Amodei 等科技 CEO 签署 AI 安全承诺,Trump 称其“具有道德约束力”。Trump 同时签署行政令,正式将 AI 更名为“超级智能”。Meta 和 OpenAI 则在为自家 AI 产品塑造更亲和的形象,而 AI 领域最大的收入仍来自企业端。
Peter Steinberger 表示 DevDay 上他最喜欢的幻灯片是一张“一人对多智能体”的架构图,并称赞了团队。该图被网友形容为智能体版的族谱,也有人称这正是他所设想的智能体工作流。相关回顾视频预计还需数周才能上线。
OpenAI 发布 GPT-6 系列模型指南,面向初创公司讲解如何选择 GPT-6 模型、调节推理强度、优化提示词与技能、协调工具调用,并为生产环境准备工作流。
Gacha Decoding 通过给 LM 配备 RNG 工具并让其"掷骰规划",把多样性来源从 token 熵转向指令遵循,样本效率比此前方法提升逾 11 倍。
PixVerse 发起活动,用 GPT-Image 2.5 UNLIMITED 把城市景观转化为博物馆礼品店风格的商品图,活动仅剩最后一天。
据《华尔街日报》报道,OpenAI与三名被指将机密信息泄露给外部AI安全机构的研究员解除关系,分别是Jasmine Wang、Tomek Korbak和Mikita Balesni,Korbak在安全团队,Wang和Balesni从事对齐工作。
餐厅、零售等一线服务人员反映,越来越多顾客拿 ChatGPT 的说法反驳专业建议,甚至无视过敏原警告。纽约服务员 Madison 称有客人坚持点含贝类的高汤鱼菜,理由是 ChatGPT 说没有贝类;酒侍也常被顾客用 ChatGPT 取代。Meta 新 AI 智能体 Muse 的推出可能加剧这一问题。
Mercor 的一项研究让 12 名平均有 5.5 年经验的持证 CPA 完成 APEX Accounting Benchmark 中的简化任务,结果显示 AI 模型在结构化记账任务上比会计师更快、更准确且成本更低。
Ramp 经济学家 Ara Kharazian 发布的 Ramp AI Index 显示,美国企业 AI 支出自 7 月见顶后持续下降,而使用量自 7 月以来上升约 50%,并在 9 月底创下新高。
MIT 的 Alex Zhang 在 Latent Space 播客中介绍了其递归语言模型(RLM)研究,基于 RLM 的 harness 是首个接近解决 ARC-AGI-3 的方案,早于 OpenAI 的 Astra。
Chatham Financial 借助 OpenAI 的 Codex 和 GPT-5.6 构建技术并重构工作流,将交易验证时间从 30 分钟缩短到 4 分钟以内。该举措用于扩展其在资本市场领域的专业能力。
OpenAI 的 GPT-6 Astra Ultrafast 已在 NVIDIA Blackwell GPU 上运行,并面向 OpenAI API 以及符合条件的 ChatGPT Work 和 Codex 用户开放。
推荐理由:OpenAI 在 NVIDIA Blackwell 上推出 Astra Ultrafast 模式,读者可了解其相对标准模式的提速幅度与开放入口。
OpenAI 发布 dots 功能的新演示视频,称此次 WiFi 连接更好。评论区大量用户质疑该功能本质只是带拨号音的语音模式,并反映 dots 通话仍无法正常接通、Pro 订阅用户看不到该功能。
OpenAI 探讨先进 AI 对突破性想法背后日常执行工作的价值,认为执行环节可能决定下一阶段经济的形态与进步速度。
Google 推出 @google/stitch CLI,可在终端连接本地编程智能体、生成界面与设计系统,并把本地 dev server 快照发送到 Stitch。此前 Stitch 已有 MCP 和 SDK,但一直没有 CLI,此次补齐了这一入口。
Albertsons 正使用 ChatGPT Enterprise 和 OpenAI API 帮助团队加快工作速度,并让数百万顾客的购物体验更便捷。
Google DeepMind 推出 Gemini 4 Argon,面向编码、企业知识工作与网络防御,首批开放给 Fairwind 计划的政府用户与可信网络安全人员,后续再向开发者、企业和消费者开放。
推荐理由:汇总了 Gemini 4 Argon 的基准、定价与可用范围,并列出同期多家模型与工具的动态,便于横向比较。
ChatGPT 现在可以直接构建和部署 MCP 服务器,并限制访问范围或公开分享。ChatGPT Sites 新增托管 MCP 服务器能力,支持插件扩展,用户通过 @sites 指令即可创建带扩展的 MCP 服务器、部署到 Sites、转为插件并自动安装到网页、移动端和桌面端。作者称 ChatGPT 正在成为任何人都能按需定制的可塑软件。
OpenAI 的 Tibo 表示,GPT-6.1 Sol 在 API 和订阅两端的需求量几乎是历来最高的,ChatGPT 与 Codex 中负载很重。团队已上线更多算力,未来数小时速度应会明显改善,接近昨天服务速度的两倍。
社交俱乐部 The Den 在新店开业之际,用 ChatGPT Work 将拨款申请从 3 天压缩到 2 小时,酒牌材料从 4 天压缩到 3 小时,每周因此省出 10-15 小时用于业务增长。
Latent Space 在 OpenAI DevDay 后采访了负责 Computer Use 产品与工程的 Ari Weinstein 和 API 产品负责人 Nikunj Handa。
ARC Prize 公布了 OpenAI GPT-6.1 Sol 在 ARC-AGI 上的完整测试结果,并同步开放排行榜、公开结果复现仓库与测试政策。相关结果可通过 arcprize.org 的排行榜页面及 GPT-6.1 Sol 专属结果页查看,复现脚本托管于 GitHub 的 arc-agi-benchmarking 仓库。
ARC Prize 公布 OpenAI 的 GPT-6.1 Sol 在 ARC-AGI 上的验证成绩:ARC-AGI-3 在标准 harness 下为 52.7%。
推荐理由:ARC Prize 给出 GPT-6.1 Sol 在三代 ARC-AGI 上的成绩与单任务成本,可对比其与 GPT-6 Astra 的性价比差异。
ARC Prize 称 GPT-6.1 Sol 在 ARC-AGI-3 上提高推理档位后决策更优,完成关卡所需动作更少,从而降低了总推理成本。在 sk48 上,使用 provider adapter(保留跨轮不透明推理状态并支持自动压缩)时,max reasoning 的 GPT-6.1 Sol 以 463 个动作完成游戏,而 low reasoning 用了 1,078 个。
OpenAI 发布新报告,探讨小企业如何将 AI 智能体用于寻找客户、构建产品和管理财务。OpenAI 同时宣布与 ASBDC 建立新合作,为小企业主提供实操 AI 培训和本地指导,帮助他们上手使用 AI。
特朗普与二十余家AI企业达成自愿协议,企业承诺实施白宫建议的管控措施,包括接受独立安全审计,审查网络安全、生物安全、化学威胁及AI模型意外行为等风险,并定期会面制定共同安全标准与基准。