NVIDIA 论文:长任务中模型准确率下降,建议给条目编号并分批处理
NVIDIA 新论文测试 7 个开源模型在加数字、排序列表等简单重复任务上的表现,128K token 任务的平均准确率比 4K token 任务低 62.8%,最好的模型在最长的任务中也只有 17.1% 全部答对。
NVIDIA 新论文测试 7 个开源模型在加数字、排序列表等简单重复任务上的表现,128K token 任务的平均准确率比 4K token 任务低 62.8%,最好的模型在最长的任务中也只有 17.1% 全部答对。
腾讯论文提出 SkillAdam,让 AI 自动改进智能体技能指令时记录已修复的问题,并在效果不稳定时只做小幅修改。在长程购物与旅行规划任务上,它平均准确率达 28.3%,高于此前最佳方法 SkillOpt 的 21.7%,token 用量约为后者的三分之一。该方法针对自动改写指令常陷入反复、新改动推翻已有修复的问题。
Arceus 成立了一家由 AI 智能体与持证律师协作的律所,端到端处理 MSA、DPA、NDA、订单和供应商协议的审查、修改、起草与谈判,客户可直接从 Slack 提交合同。每份合同人工审查平均耗时 4 到 6 小时,无内部法务的初创公司可在数小时内收到红线修改稿,且每项工作采用客户事先确认的固定价格。该公司以 1700 万美元融资启动,由 GreyCraft 领投。
Arceus 推出一家结合 AI 智能体与执业律师的律所,面向初创和成长期公司处理商业合同,可端到端审查、修订、起草和谈判 MSA、DPA、NDA、订单表单和供应商协议。
论文 AgentBug-Smith 提出自动复现智能体系统中真实 harness bug 的方法,指出这类 bug 具有独特特征,当前最先进的软件智能体仍难以修复。现有 benchmark 也进一步阻碍了该方向的进展。
Grok Bot 正在逐步推送 Primary Bot 功能,用户需配置一个新的 Primary Bot 或选择一个已有 Bot 作为 Primary,例如把 Chief of Stuff 设为 Primary。Primary Bot 定位为主 AI 助手,可以管理其他 Bot 并主动给出建议,相关入口已出现在最新 iOS 应用中。
来自中美顶尖实验室的论文提出 AgentBug-Smith,可将真实 GitHub bug 报告自动转化为可运行测试,构建出持续增长的 200 个 bug 基准。3 个编程智能体中表现最好的仅修复 9% 的 Agent 框架 bug,而普通软件 bug 的修复率约为 40%。一份过往修复经验简编让某智能体在 79 个未见 bug 上的正确修复数从 1 提升到 6。
Grok Bot 新增 Primary Bot 功能,开始具备主动性,可自行给出建议。用户需要配置一个新的 Primary Bot,或从已有 Bot 中选一个作为 Primary,例如把 Chief of Stuff 设为 Primary。该功能正在逐步推送,Bot prime 已出现在最新的 iOS 应用中。
Anthropic 为 Claude Code 推出 Mods,用户可借此改写或替换 Claude Code 的行为,甚至绘制自定义 UI。Mods 底层是 hooks,随插件分发,每个是一个运行在会话中的小型 JavaScript 或 TypeScript 模块,可实时看到每个事件,并可通过 Claude Directory 分享给他人。
Grok 4.7 正在 Grok 网页版和移动端推送,成为 Fast、Expert、Build、Heavy 全部模式的基座模型,并上线 Google 的 Gemini Enterprise Agent Platform;Grok Bot 逐步转向主动建议,Grok Build 新增 /dashboard 智能体面板。
DeepSeek Harness v0.2 是一款由 DeepSeek 模型驱动的桌面应用,现已登陆 macOS、Windows 和 Linux,可执行工作与编码任务,并开箱支持 Plugins 和 Workspaces。
Gemini 桌面端一项设置显示,其 Computer Use 能力将扩展到选定文件夹之外,并支持联网访问和跨应用操作,且无需每一步都获得批准。该功能目前仍处于测试阶段。
Gemini Desktop 将提供面向 computer use 的 Full Access 权限,可访问桌面任意文件并运行任意应用。
AI 初创公司 Photon 完成 450 万美元种子轮融资,用于开发让开发者通过 iMessage、WhatsApp 等消息应用构建智能体的工具。该公司称已吸引超 4 万名开发者注册,四个月内收入增长 10 倍,消息量上月增长 5 倍。Photon 提供统一 API、可扩展渠道框架、CLI 和可观测性套件,其开源版本仍占使用量的 98%。
Airbnb 本周随秋季更新上线了新的 AI 搜索,CEO Brian Chesky 表示聊天机器人不适合电商与旅行浏览,因为一次只给几个选项、需要多轮交互。他透露公司未来三到六个月将探索支持多人同时使用的"multiplayer" AI 界面,并计划让 Airbnb 应用更"agentic",最终通过 MCP 与其他智能体互通。
Shopify 推出名为 Canvas 的建站工具,商家通过与 AI 智能体 Sidekick 对话即可搭建店铺,Canvas 实时渲染店铺背后的真实代码,可测试页面交互与动画并查看不同屏幕尺寸下的效果。
AWS 发布开源决策模型 Strands Decider 2B,基于 Qwen3.5-2B 构建,可在本地运行,用于在预设选项中快速做出选择并给出置信度评分。该模型由 AWS 杰出工程师 Marc Brooker 受 TypeSafe 的 Jev 启发开发,曾在同尺寸模型的 Jevbench 排名中登顶。
Clay 联合创始人兼 CEO Kareem Amin 将在 TechCrunch Disrupt 2026 的 AI Stage 发表演讲,主题为“GTM 工程师:AI 如何创造科技业下一个大职位类别”。
Runway Labs 发布 Project Continuum,一个围绕实时视频界面构建的操作系统研究应用,并给出四种与电脑交互方式的早期预览:Portals、Visual Thinking、Responsive Video Interfaces 和 Interactive Worlds。
Runway Labs 发布 Project Continuum,一个围绕实时视频界面构建的操作系统研究应用,并首次展示四种与电脑交互的新方式:Portals、Visual Thinking、Responsive Video Interfaces 和 Interactive Worlds。
Runway Labs 发布 Project Continuum,一个围绕实时视频界面构建的操作系统研究应用,并首次展示四种与电脑交互的新方式:Portals、Visual Thinking、Responsive Video Interfaces 和 Interactive Worlds。
Claude Sonnet 5.5 的 xHigh 推理档位进入 Code Arena WebDev 榜单,以 1786 分排名第 3,混合价格 $8/M tokens,距第 2 名 GPT-6 Astra 的 1788 分仅差 2 分,价格约为其 80%。
小米 MiMo-V2.6-Pro 和 MiMo-V2.6-Flash 进入 Agent Arena,Pro 在开源模型中排名第 5,在 8.1K+ 真实智能体会话中净提升 +3.17%,较 MiMo-V2.5-Pro 的第 13 名提升 9 位、提高 10.4 个百分点。
推荐理由:Agent Arena 的实测排名与成本数据,可用来对比 MiMo-V2.6 两个版本在真实智能体会话中的表现差异。
Arena 发布本周榜单更新,四款新模型改变了 Text、Code 和 Agent Arena 的帕累托前沿。
Arena 公布 Claude Sonnet 5.5(Max)首次进入 Agent Arena 即排名第 3,净提升 +12.5%,比排名第 13 的 Claude Sonnet 5(High,+4.4%)高出 8.1 个百分点;在 Chat 分类中以 +15.6% 位列第 1,高于 Fable 5.1(+11.49%)和 Opus 5.5(+10.29%)。
Arena 公布 Claude Sonnet 5.5 (Max) 在 Agent Arena 首次上榜即排名第 3,净提升 +12.5%,比排名第 13 的 Claude Sonnet 5 (High) 高出 8.1 个百分点。
推荐理由:榜单给出了 Claude Sonnet 5.5 在 Agent Arena 与 Code Arena 的排名、分数和每任务成本,可据此比较它与 Opus 5.5、GPT-6 Astra 的性价比。
Arena 上线 Agent Arena 帕累托前沿(Pareto frontier)实时结果页面,可在 arena.ai/leaderboard/agent/overall/pareto 查看。该页面展示智能体在整体维度上的实时排名与帕累托前沿分布。
Anthropic 的 Claude Sonnet 5.5(Max)在 Agent Arena 首次上榜即位列第 3,净提升 +12.5%,比排名第 13 的 Claude Sonnet 5(High,+4.4%)高出 8.1 个百分点。
OpenAI Developers 转发了一段 dots 在 Apple Watch 上的演示,并称其"WiFi 更好了"。用户可通过 TestFlight 更新至最新版本,目前仍以私信邀请方式发放 beta 测试名额。
开发者 Elizabeth Siegle 用 OpenAI 智能体做出首款 ModRetro Chromatic 掌机游戏,玩家在游戏中经营马萨诸塞州西部一家关注新冠防护的女同性恋酒吧,并撑过小丑学校 Zoom 混乱的周六班次来赚取积分和社区支持。该项目上周末以 webapp 起步,拿到 Chromatic 硬件后转为 Gameboy 应用,全部智能体会话记录发布在 EntireHQ 上。
一名用户在自动驾驶汽车行驶途中,用 Codex 安装了一款由 AI 在他睡觉时自行制作的游戏。该用户称这一体验"太疯狂了",并 @OpenAI 与 @OpenAIDevs 分享。评论区有人追问游戏内容,也有人调侃"Codex 交付了游戏,汽车交付了通勤"。
OpenAI Developers 9 月更新中,GPT-6.1 与常驻 AI 智能体 dots 成为 DevDay 之后可上手尝试的新内容。dots 是始终在线的 AI 智能体,拥有自己的云计算机,能够编写代码、修复 bug 等。
OpenAI Developers 介绍 dot 能学习用户工作方式、跨应用保留上下文、协调 Codex 任务并提示需要关注的事项。开发者 dominik kundel 表示 dot 与 Codex 配合良好,dot 已成为他使用 Codex 的首选方式,可减少心智负担,其主动性很实用。
OpenAI Agents API 团队公布本周更新,新增 Computer use 能力,可通过 1 次 API 调用启动浏览器加智能体。同时上线 Bedrock Managed Agents(Agents API 接入 AWS)、可选轻量或高性能的 oai 托管环境规格、Dashboard 中配置 subagents、环境可在多个会话间复用。
OpenRouter 在个人资料下拉菜单中新增入口,可快速查看所有智能体、所有模型的近期 AI 会话,统一汇总在 openrouter.ai/logs 的 sessions 标签页。该功能将跨智能体、跨模型的会话集中到一处,便于切换和管理。
OpenClaw v2026.9.8 发布,新增 GPT-6.1 Sol 支持,修复 Agent 回复丢失与 Windows 启动问题,并降低内存占用。该版本包含 43 个 PR、8 位贡献者,但 GPT-6.1 Sol 因捆绑的 codex CLI 0.158.0 版本过旧而尚不可用,需 0.160.0 以上版本。
Jason Liu 反驳「这些演示不真实」的说法,称质疑者是把醒着的时间都花在了 Twitter 上。他指出真正不真实的是演示用户而非智能体:演示用户清楚该问什么,而真实学习者只会高亮一句话然后输入「huh??」。
OpenAI 发布 GPT-6 系列使用指南,将 GPT-6 Astra、Sol、Luna 的选型落到任务难度、延迟与成本,并给出推理强度、提示词与技能边界调整建议。
Meta 于周五推出开源项目 Muse Gadgets,提供开源固件和 Linux SDK,让开发者用 Raspberry Pi 或 ESP32 等低成本硬件搭建可连接 Muse 的设备,例如彩色电子墨水屏或插入电视 HDMI 接口的棒状设备,并设有 Discord 频道支持用户。
OpenAI Developers 公布 Agents API 本周更新:Computer use 支持用 1 次 API 调用启动浏览器加智能体,Bedrock Managed Agents 提供 AWS 上的 Agents API(除 GPT-6.1 Sol 外),并新增轻量或高配的 oai 托管环境规格。