Databricks 用 GPT-6 Astra 与 Opus 5 智能体登顶 NVIDIA SOL-ExecBench kernel 榜单
Databricks 在 NVIDIA 的 SOL-ExecBench kernel 榜单全部 4 个赛道排名第一,做法是把 GPT-6 Astra 和 Opus 5 放进自我爬坡循环,让智能体在 GPU kernel 任务上超过顶尖 kernel 工程师。
Databricks 在 NVIDIA 的 SOL-ExecBench kernel 榜单全部 4 个赛道排名第一,做法是把 GPT-6 Astra 和 Opus 5 放进自我爬坡循环,让智能体在 GPU kernel 任务上超过顶尖 kernel 工程师。
Databricks 在 NVIDIA 的 SOL-ExecBench 内核排行榜上排名第一,覆盖全部 4 个赛道。团队把 GPT-6 Astra 和 Opus 5 放进自我爬坡循环,智能体表现超过顶尖 GPU 内核工程师,总 token 花费约 7 万美元,远低于内核工程师的薪酬。作者提到一个发现,GPT-6 Astra 和 Opus 5 在编写 GPU 内核上仍明显优于开源模型。
Manus 2.0 活动系列将走向全球,以线上和线下形式举办 Founder Briefing、Roadshow 及 Fellow 主导的社区 Meetup。首场 Founder Briefing 网络研讨会由联合创始人兼 CPO @hidecloud 于 9 月 30 日 10 PM SGT 主讲,介绍 Manus 2.0 的构建思路与使用方式。
Latent Space 的 AINews 汇总 9/24-9/25 动态,指出 Opus 5.5 本周发布后在讲解视频生成上表现突出,SimpleBench 达 88.4%,被 @skalskip92 评为 Anthropic 迄今最强视觉模型。
Anthropic 的 Thariq Shihipar 在 Latent Space 播客中谈 Claude Code 的下一阶段,包括 Ask User Question、Artifacts、Claude Tag、Projects 和可自定义 harness 的 Claude Mods。
Amazon AGI 提出 AutoGym,可从少量领域种子或过往模型轨迹出发,同时生成任务、可执行环境与验证器,用于为智能体构建强化学习环境。该工作将"创建 RL 环境"视为一项重要的 AI 工程新技能,作者认为这一方向正出现明显转变。论文已发布在 arXiv(2609.22592)。
Grok Bot 推出 Team Bots,机器人会监听 Slack 中的消息并静默收集上下文,而不是对每条消息都作出回应。作者称团队已把更多 grok.com 开发工作转移到 Slack,机器人写代码和给出新洞察时都会把结果回流到项目共享上下文,团队成员无需在各自机器上重建上下文。
OpenAI 发布 dots,将其定义为可跨复杂项目和日常任务持续推进的主动式助手。官方说明 dots 让用户在任务推进过程中保持控制权,具体能力与开放方式尚未在摘要中给出。
推荐理由:OpenAI 官方给出 dots 的定位与可控性说明,读者可据此判断这类主动式助手与现有工具的分工。
Manus Studio 被用来制作了一支发布视频,@Nin19536 提供了部分人工润色。发布者称三个月前还不会相信智能体能做出这样的发布视频。
Anthropic 发布 Claude Sonnet 5.5,并配有一份构建指南,内容涵盖 Sonnet 5.5 与 Opus 5.5 之间的选择、从 Sonnet 5 迁移及 effort 调优、以及在 Claude Code 中使用该模型。指南链接为 claude.dev/blog/building-with-claude-sonnet-5-5/。
Manus 2.0 现在可以构建游戏,官方称操作非常简单。官方在推文串中展示了用 Manus 制作的数十款游戏、提示词和可玩 demo。
Replit 将于周二上午 9 点(太平洋时间)在 YouTube、LinkedIn 和 X 直播 Just Ask Replit,探讨知识工作的未来。活动聚焦在智能体对话内完成实时数据、可视化与自动化,提问即可获得图表、流水线或可用的自动化,无需搭建仪表盘,也不用排队等工程资源。
Replit 将举办「Just Ask Replit」直播深潜活动,探讨知识工作的未来:实时数据、可视化与自动化全部在智能体对话内完成,无需搭建仪表盘,也无需排工程队列。活动于周二上午 9 点(PT)在 YouTube、LinkedIn 和 X 同步直播。
Claude 现在可以帮助用户构建评测(eval)并对其做 hillclimb。官方文章分享了评测设计的原则,以及 Claude Code 中 claude-api 技能的 build-eval 和 hillclimb 命令如何把这些原则落地,用于改进应用。原文链接:https://claude.dev/blog/automating-eval-design-and-hillclimbing/
Anthropic 官方账号发布了一组 Claude Sonnet 5.5 的早期实验合集,涵盖落叶模拟器、3D 模型、恐龙历史动画、森林光影实时渲染、流程图工具、像素森林生物和弹跳球物理测试等作品。
Cognition 宣布 Devin 开放下载,提供 Mac、Windows 和 Linux 桌面版本,下载入口为 devin.ai/download。Devin 同时以 JetBrains 插件和 CLI 形式提供。
Claude Sonnet 5.5 现已在 Devin Desktop 和 Devin CLI 中可用,在 FrontierCode 1.1 Main 上得分 64.4%,高于 Sonnet 5 的 56.2%,并超过 Fable 5.1 的 extra high reasoning effort 表现。
推荐理由:Devin 上线 Claude Sonnet 5.5,并给出 FrontierCode 1.1 分数与成本变化,可据此判断编码智能体的性价比。
Cognition 宣布 Claude Sonnet 5.5 已在 Devin Desktop 和 Devin CLI 中可用,在 FrontierCode 1.1 Main 上得分 64.4%,高于 Sonnet 5 的 56.2%,并在 extra high reasoning effort 下超过 Fable 5.1。
推荐理由:Devin 上线 Claude Sonnet 5.5 并给出 FrontierCode 1.1 分数与 Sonnet 5 的对比,可据此判断编码智能体的模型选择。
xAI 宣布 Team Bots 进入公开测试,面向 Teams 和 Enterprise 用户开放。据其介绍,Team Bots 在 xAI 内部用于每天为客户团队做准备、协调工程工作、回答数据问题、分类客户反馈以及运行招聘流程。用户可向 Grok Bot 提供文件、应用和专业知识,再分享给团队,让成员基于同一上下文协作,详情见 x.ai/news/team-bots。
Grok Bot 推出 Team Bots,定位为随团队协作不断学习的共享 AI 队友。用户可为 Team Bot 配置其角色所需的技能、插件和凭证,然后在 Slack 或 Grok Bot 中与它协作。
吴恩达宣布其开源智能体框架 OpenWorker 将基于 NVIDIA OpenShell,支持在沙箱内运行每个智能体的命令,默认无法访问密钥、浏览器登录凭据和任意网站。
Google AI Pro 用户现可在 Gemini App 中启用 24/7 个人 AI 智能体,代为处理收件箱整理、未读邮件、会议请求和待办事项等日常琐事。该智能体主打任务委派,让用户把例行工作交出去,把时间留给更重要的事。
PINOC MCP 可将游戏 3D 角色与动画制作的工作量削减 90%。Viggle AI 让 Claude Opus 5.5 借助 PINOC MCP 提供的 3D 角色与动画,在 2 小时内做出了秋叶氛围的 Subway Surfers。提示词、MCP 与游戏链接见原帖。
Google 发布实验性 AI 智能体 CC,专为家庭场景打造,用于应对繁忙日程、堆积的收件箱和无尽待办事项。该智能体针对家庭管理中的多任务切换与时间消耗问题设计,目前仍处于实验阶段。
Mistral CEO Arthur Mensch 转发 NVIDIA CEO 黄仁勋的推文,并配文称只有开放生态才能保障 AI 安全。黄仁勋在推文中表示,NVIDIA 与超过 100 家行业伙伴推出 NVIDIA Open Agent Safety Platform,整合 OpenShell 与 Sentry,目标是构建安全智能体系统的信任层。
Anthropic 发布 Claude 5.5 家族的第二款模型 Claude Sonnet 5.5,官方称其比 Sonnet 5 更聪明、更高效,运行速度提升超过 30%,大多数工作的成本最多降低 30%。该模型适合修复 bug、快速迭代功能等范围明确的日常任务,成本下降也让 Claude Code 的用量更耐用。
推荐理由:Claude Sonnet 5.5 给出速度与成本的具体变化,读者可据此判断日常编码任务的开销与效率。
Cognition 宣布 Devin 成本效率最高提升 40%,Fusion 和 Normal 模式便宜 30-40%,Ultra 模式便宜 15-20%,Devin Review 最高便宜 70%,原因是采用了最新模型和更高效的 harness。
Cognition 宣布 Devin 更新后大幅降价:Fusion 和 Normal 便宜 30–40%,Ultra 便宜 15–20%,Devin Review 最高便宜 70%,同时能力有所提升,Devin Fusion 在 FrontierCode 1.1 Extended 上排名第一。
Manus 发布 Manus 2.0 视频。
Replit 发布更新,支持为 Meta Quest VR 构建应用、通过 Muse 创建 Replit 应用、接入 Airwallex 支付,并新增 GPT-Sol 6、GPT-6 Luna、Opus 5.5 三款模型。用户还可直接在对话中绘制数据图表并获取洞察,企业版支持在工作流内申请和控制访问权限。
黄仁勋宣布与超过 100 家行业伙伴推出 NVIDIA Open Agent Safety Platform,整合 OpenShell 与 Sentry。他表示这不只是单一产品,而是构建安全智能体系统信任层的开放生态起点,并称信任与创新并不冲突,安全是赢得信任的方式。
Cognition 的 Devin Mobile 已开启 beta 测试,用户可通过链接加入等待名单。该版本让 Devin 智能体在手机上运行,评论区大量用户追问是否支持 Android,目前信息显示仅限 iOS。
Cognition 上线 Devin Mobile 并开放等待名单,用户可通过 devin.ai/ios 加入。该页面为 Devin 移动端入口,目前尚未公布具体功能与发布时间。
Salesforce AI Research 提出 Critical-State RL,用于多轮工具调用的强化学习:当奖励依赖后续回合时,只训练真正改变结果的那一次调用,而非把奖励摊到整条轨迹上。
一项新研究测试个人智能体在航班、健康保险和研究生项目上的推荐行为,在 13 个模型上运行了 32.5 万次实验。当请求完全相同时,8 个模型为被推断为富有的用户选择了更贵的选项,Claude Opus 4.8 的差距达到每张机票 198 美元、每月保险 284 美元;富有的用户要求最便宜航班时,Gemini 2.5 Flash 仍选了高出 208 美元的选项。
NVIDIA 联合 100 多家行业伙伴推出 NVIDIA Open Agent Safety Platform,整合 OpenShell 与 Sentry。黄仁勋称这是构建安全智能体系统信任层的开放生态起点,并强调信任与创新并不冲突,安全是赢得信任的方式。
有人用 Tavily 抓取 arXiv 最近 7 天论文,再由部署在 Nebius Token Factory 上的 NVIDIA Nemotron 3 Ultra 阅读排序,约 10 秒就在终端拿到本周智能体记忆方向 Top 5 论文。
Higgsfield AI 让 Claude Opus 5.5 接入 12 台笔记本电脑,仅凭一条提示词就完成整支发布视频。借助 Computer Use 与 Higgsfield MCP,它将任务分配到每台电脑,生成视觉素材、制作动画,并组装出可完全编辑的 After Effects 工程文件。
Hugging Face 与 NVIDIA 等 100 多家行业伙伴发布 NVIDIA Open Agent Safety Platform,包含开源(Apache 2.0)的 OpenShell 与 Sentry。
Meta 启动新的业务支柱 Meta Enterprise Platform,帮助企业在 AI 上实现增长和转型,初期将把包括 Muse agent、Meta Business Agent、Muse API、Muse Code 在内的完整技术栈提供给企业和开发者。