Claude Sonnet 5.5 进入 Code Arena WebDev 榜单,xHigh 档位排名第 3
Claude Sonnet 5.5 的 xHigh 推理档位进入 Code Arena WebDev 榜单,以 1786 分排名第 3,混合价格 $8/M tokens,距第 2 名 GPT-6 Astra 的 1788 分仅差 2 分,价格约为其 80%。
Claude Sonnet 5.5 的 xHigh 推理档位进入 Code Arena WebDev 榜单,以 1786 分排名第 3,混合价格 $8/M tokens,距第 2 名 GPT-6 Astra 的 1788 分仅差 2 分,价格约为其 80%。
小米 MiMo-V2.6-Pro 和 MiMo-V2.6-Flash 进入 Agent Arena,Pro 在开源模型中排名第 5,在 8.1K+ 真实智能体会话中净提升 +3.17%,较 MiMo-V2.5-Pro 的第 13 名提升 9 位、提高 10.4 个百分点。
推荐理由:Agent Arena 的实测排名与成本数据,可用来对比 MiMo-V2.6 两个版本在真实智能体会话中的表现差异。
Arena 发布本周榜单更新,四款新模型改变了 Text、Code 和 Agent Arena 的帕累托前沿。
Arena 公布 Claude Sonnet 5.5(Max)首次进入 Agent Arena 即排名第 3,净提升 +12.5%,比排名第 13 的 Claude Sonnet 5(High,+4.4%)高出 8.1 个百分点;在 Chat 分类中以 +15.6% 位列第 1,高于 Fable 5.1(+11.49%)和 Opus 5.5(+10.29%)。
Arena 公布 Claude Sonnet 5.5 (Max) 在 Agent Arena 首次上榜即排名第 3,净提升 +12.5%,比排名第 13 的 Claude Sonnet 5 (High) 高出 8.1 个百分点。
推荐理由:榜单给出了 Claude Sonnet 5.5 在 Agent Arena 与 Code Arena 的排名、分数和每任务成本,可据此比较它与 Opus 5.5、GPT-6 Astra 的性价比。
Arena 上线 Agent Arena 帕累托前沿(Pareto frontier)实时结果页面,可在 arena.ai/leaderboard/agent/overall/pareto 查看。该页面展示智能体在整体维度上的实时排名与帕累托前沿分布。
Anthropic 的 Claude Sonnet 5.5(Max)在 Agent Arena 首次上榜即位列第 3,净提升 +12.5%,比排名第 13 的 Claude Sonnet 5(High,+4.4%)高出 8.1 个百分点。
OpenAI Developers 转发了一段 dots 在 Apple Watch 上的演示,并称其"WiFi 更好了"。用户可通过 TestFlight 更新至最新版本,目前仍以私信邀请方式发放 beta 测试名额。
开发者 Elizabeth Siegle 用 OpenAI 智能体做出首款 ModRetro Chromatic 掌机游戏,玩家在游戏中经营马萨诸塞州西部一家关注新冠防护的女同性恋酒吧,并撑过小丑学校 Zoom 混乱的周六班次来赚取积分和社区支持。该项目上周末以 webapp 起步,拿到 Chromatic 硬件后转为 Gameboy 应用,全部智能体会话记录发布在 EntireHQ 上。
一名用户在自动驾驶汽车行驶途中,用 Codex 安装了一款由 AI 在他睡觉时自行制作的游戏。该用户称这一体验"太疯狂了",并 @OpenAI 与 @OpenAIDevs 分享。评论区有人追问游戏内容,也有人调侃"Codex 交付了游戏,汽车交付了通勤"。
OpenAI Developers 9 月更新中,GPT-6.1 与常驻 AI 智能体 dots 成为 DevDay 之后可上手尝试的新内容。dots 是始终在线的 AI 智能体,拥有自己的云计算机,能够编写代码、修复 bug 等。
OpenAI Developers 介绍 dot 能学习用户工作方式、跨应用保留上下文、协调 Codex 任务并提示需要关注的事项。开发者 dominik kundel 表示 dot 与 Codex 配合良好,dot 已成为他使用 Codex 的首选方式,可减少心智负担,其主动性很实用。
OpenAI Agents API 团队公布本周更新,新增 Computer use 能力,可通过 1 次 API 调用启动浏览器加智能体。同时上线 Bedrock Managed Agents(Agents API 接入 AWS)、可选轻量或高性能的 oai 托管环境规格、Dashboard 中配置 subagents、环境可在多个会话间复用。
OpenRouter 在个人资料下拉菜单中新增入口,可快速查看所有智能体、所有模型的近期 AI 会话,统一汇总在 openrouter.ai/logs 的 sessions 标签页。该功能将跨智能体、跨模型的会话集中到一处,便于切换和管理。
OpenClaw v2026.9.8 发布,新增 GPT-6.1 Sol 支持,修复 Agent 回复丢失与 Windows 启动问题,并降低内存占用。该版本包含 43 个 PR、8 位贡献者,但 GPT-6.1 Sol 因捆绑的 codex CLI 0.158.0 版本过旧而尚不可用,需 0.160.0 以上版本。
Jason Liu 反驳「这些演示不真实」的说法,称质疑者是把醒着的时间都花在了 Twitter 上。他指出真正不真实的是演示用户而非智能体:演示用户清楚该问什么,而真实学习者只会高亮一句话然后输入「huh??」。
OpenAI 发布 GPT-6 系列使用指南,将 GPT-6 Astra、Sol、Luna 的选型落到任务难度、延迟与成本,并给出推理强度、提示词与技能边界调整建议。
Meta 于周五推出开源项目 Muse Gadgets,提供开源固件和 Linux SDK,让开发者用 Raspberry Pi 或 ESP32 等低成本硬件搭建可连接 Muse 的设备,例如彩色电子墨水屏或插入电视 HDMI 接口的棒状设备,并设有 Discord 频道支持用户。
OpenAI Developers 公布 Agents API 本周更新:Computer use 支持用 1 次 API 调用启动浏览器加智能体,Bedrock Managed Agents 提供 AWS 上的 Agents API(除 GPT-6.1 Sol 外),并新增轻量或高配的 oai 托管环境规格。
OpenClaw 新增 50 多个插件,来自 Notion、Canva、Dropbox 等公司。用户可以直接在聊天中让智能体安装插件,插件支持热重载,无需重启 gateway。
苹果表示正在修改 macOS 隐私设置,以阻止第三方应用开发者滥用权限访问消息记录。此事源于两周前专栏作者 Jason Aten 称 Meta 的通用 AI 智能体 Muse 向他发送了一条未经请求的通知,内容涉及他与同事在 Apple Messages 中的对话,而他从未授予 Muse 读取消息的权限。
Replit 本周上线聊天内交互式图表,用户对 Replit Agent 说 "let's visualize this" 即可在对话中生成可视化。同时新增 GPT-6.1 Sol 和 Claude Sonnet 5.5 两个可选模型,前者擅长复杂任务,后者面向日常功能与修复,用户可在 Agent 中手动选择或保持 auto 模式。
OpenAI DevDay 笔记指出,构建智能体应用优化成本与性能的 4 个关键杠杆是 prompt caching、reasoning effort、programmatic tool calling 和 batch request。这些是 OpenAI 开发文档之外值得优先尝试的起点,建议熟悉后用 evals 进行测量。
OpenRouter 推出 Model Router Benchmarks,在 6 项基准上从质量、速度、成本三个维度对比 7 个模型路由,涵盖 Jev Router、Unbiased Pareto、NVIDIA Switchyard 等。
vLLM 与 Cohere 将在多伦多联合举办 meetup,讨论双方对开源生态的贡献与未来方向。vLLM 的一位核心维护者将分享 vLLM 的下一步规划,NVIDIA AI 工程师则将讲解智能体调试。活动面向开发者开放,可与双方团队现场交流。
Meta 开源了相关代码,让用户可以自制搭载其新 AI 智能体的 Muse 硬件。Meta 建议的玩法包括把 Muse 装到彩色 E Ink 屏上显示提醒、装到 HDMI 棒上在大屏显示。
Perplexity CEO Aravind Srinivas 展示 Computer 用智能体连续运行数小时,为纽约全部五个行政区近 26,000 家餐厅和咖啡馆构建了 3D 地图。用户可按菜品或街区搜索,并进入 Peter Luger、Grand Central Oyster Bar 等场所内部查看。他表示这类项目只需交给智能体运行数小时即可产出成果,创意是唯一限制。
Claude Code 的 mods 本质上是带有若干特殊函数的插件,能让你的代码在 Claude Code 内部运行,作用类似中间件。官方表示可以直接让 Claude 帮你编写这些 mods。
OpenAI DevDay 主舞台上介绍了 ChatGPT 插件扩展(plugin extensions),开发者可构建从 ChatGPT 侧边栏、侧边面板、自定义文件查看器与编辑器以及插件设置中打开的应用,完整规范见 github.com/openai/mcp-extensions。
Claude Code 新增内置插件 You Should Know,可扫描 Claude 输出中可能被忽略的重要信息,帮助用户保持同步。该插件通过 `/plugin enable cc-plugin-you-should-know@builtin` 启用,是 mods 能力的一个示例。
Claude Devs 介绍 Claude Code mods 的工作方式:mods 是随插件分发、在 Claude Code 会话内运行的 hooks,"You should know" 就是一个通过派生 sideagent 观察 Claude 输出的 mod。官方博客还演示了如何从空文件夹构建一个 mod,并展示两个更完整的 mod 案例。
Muse 宣布推出 Muse Gadgets 与 Muse Home Link。Muse Gadgets 是开源 ESP32 固件和 Linux SDK,供开发者制作可与 Muse 配合的硬件;Muse Home Link 是让 Muse 连接电视、音箱等智能设备的硬件,用户可在官网认领。
Apple 宣布将在 Mac 上新增对全盘访问权限的限制,要求用户通过非常明确的主动操作才能授予应用这一权限。Apple 表示,部分开发者使用全盘访问的方式可能让用户面临风险,暴露文件、邮件、信息和浏览历史等内容,并称随着 AI 智能体能力与自主性增强,这类访问带来的风险将大幅上升。Apple 未说明该更新的具体推出时间。
Ethan Mollick 应读者要求,把其文章中关于 Bitter Lesson 的视频上传到了 YouTube。他撰文讨论了自己最低估的 AI 进展——AI 自我组织完成任务的能力,以及这对 Muse、Dots 等智能体意味着什么,并配了一支音乐视频解释为何人们不断重新领悟 Bitter Lesson。
Arena 上线 Agent Arena 帕累托前沿(Pareto frontier)实时结果页面,可在 arena.ai/leaderboard/agent/overall/pareto 查看。该页面展示智能体在整体维度上的实时排名与帕累托前沿分布。
Arena 宣布 OpenAI 的 GPT-6.1 Sol (Max) 进入 Agent Arena 第 5 名,提升 11.23%,并重塑帕累托前沿。其单任务中位成本为 $0.56,比 GPT-6 Sol 低 39% 且得分高 1.52 分,比 GPT-6 Astra 低 81% 且得分差距 1.04 分。
推荐理由:Agent Arena 榜单显示 GPT-6.1 Sol 以更低单任务成本进入前五,读者可据此比较它与 GPT-6 Sol、Claude 系列的性价比差距。
Perplexity 表示期待在 SPACE 上使用 NVIDIA 新款 Vera CPU,NVIDIA 团队已到访并交付该芯片。Perplexity 称其正在构建的许多能力依赖智能体安全可靠地运行更强的代码环境,因此对在 Vera 上测试这项工作感到兴奋。
OpenAI 预告了由 GPT-6 Astra 驱动的 dots,定位为能力出众、始终在线的智能体,可处理各类任务。swyx 提醒外界不要忽略这一"one more thing",并称 OpenAI 在 dots 上已投入一段时间。
Replit 官方账号发文「Go forth and build」,鼓励用户动手构建。有用户回复称,前一天用其 agent 做了一个简单的 CSV 清理工具,并称把这类枯燥的活儿交付出去有种奇特的满足感。
xAI 发布实验性 TypeScript SDK,可通过 `npm install @xai-official/sdk` 安装,在一个 SDK 中调用 Grok 最新模型的文本、语音、图像和视频能力。该 SDK 还支持运行在 xAI 服务器上的工具,包括实时 X 搜索、网页搜索、代码执行和远程 MCP。官方称目前仍处早期阶段,希望开发者反馈以持续迭代。