OpenClaw 新增 50+ 插件,支持聊天内安装与热重载
OpenClaw 新增 50 多个插件,来自 Notion、Canva、Dropbox 等公司。用户可以直接在聊天中让智能体安装插件,插件支持热重载,无需重启 gateway。
OpenClaw 新增 50 多个插件,来自 Notion、Canva、Dropbox 等公司。用户可以直接在聊天中让智能体安装插件,插件支持热重载,无需重启 gateway。
苹果表示正在修改 macOS 隐私设置,以阻止第三方应用开发者滥用权限访问消息记录。此事源于两周前专栏作者 Jason Aten 称 Meta 的通用 AI 智能体 Muse 向他发送了一条未经请求的通知,内容涉及他与同事在 Apple Messages 中的对话,而他从未授予 Muse 读取消息的权限。
Replit 本周上线聊天内交互式图表,用户对 Replit Agent 说 "let's visualize this" 即可在对话中生成可视化。同时新增 GPT-6.1 Sol 和 Claude Sonnet 5.5 两个可选模型,前者擅长复杂任务,后者面向日常功能与修复,用户可在 Agent 中手动选择或保持 auto 模式。
OpenAI DevDay 分享指出,构建智能体应用时优化成本与性能的 4 个关键杠杆是 prompt caching、reasoning effort、programmatic tool calling 和 batch request。这些是优化智能体应用的起点,OpenAI 开发文档提供了更多信息,建议熟悉并用 evals 进行测量。
OpenRouter 推出 Model Router Benchmarks,在 6 项基准上从质量、速度、成本三个维度对比 7 个模型路由,涵盖 Jev Router、Unbiased Pareto、NVIDIA Switchyard 等。
vLLM 与 Cohere 将在多伦多联合举办 meetup,讨论双方对开源生态的贡献与未来方向。vLLM 的一位核心维护者将分享 vLLM 的下一步规划,NVIDIA AI 工程师则将讲解智能体调试。活动面向开发者开放,可与双方团队现场交流。
Meta 开源了相关代码,让用户可以自制搭载其新 AI 智能体的 Muse 硬件。Meta 建议的玩法包括把 Muse 装到彩色 E Ink 屏上显示提醒、装到 HDMI 棒上在大屏显示。
Perplexity CEO Aravind Srinivas 展示 Computer 构建的纽约全市五区近 26,000 家餐厅和咖啡馆 3D 地图,支持按菜品或街区搜索,并可进入 Peter Luger、Grand Central Oyster Bar 等场所内部。他表示这类项目可以让 agent 连续运行数小时,产出令人满意的结果,用户的创造力是 Computer 能力的上限。
Claude Code 的 mods 本质上是带有若干特殊函数的插件,能让你的代码在 Claude Code 内部运行,作用类似中间件。官方表示可以直接让 Claude 帮你编写这些 mods。
OpenAI DevDay 主舞台上介绍了 ChatGPT 插件扩展(plugin extensions),开发者可构建从 ChatGPT 侧边栏、侧边面板、自定义文件查看器与编辑器以及插件设置中打开的应用,完整规范见 github.com/openai/mcp-extensions。
微软在 Hugging Face 发布 4B 模型 FrogNano-4B-2609,基于 Qwen3.5-4B 用 TaskPilot 合成任务纯 RL 后训练,仅 5 轮迭代、每轮 300 个任务,零蒸馏。该模型在 SWE-bench Verified 上取得 61.5%。
Perplexity 近期开源了多项成果,包括 pplx-decider-v1-27b 多模态决策模型,在 11 项基准上平均得分 85.7%,领先 Jev;pplx-embed-v2-context-9b-preview 上下文嵌入模型在 ConTEB 和 turbopuffer context-bench 上表现最佳。
Claude Code 新增内置插件 You Should Know,可扫描 Claude 输出中可能被忽略的重要信息,帮助用户保持同步。该插件通过 `/plugin enable cc-plugin-you-should-know@builtin` 启用,是 mods 能力的一个示例。
Claude Devs 介绍 Claude Code mods 的工作方式:mods 是随插件分发、在 Claude Code 会话内运行的 hooks,"You should know" 就是一个通过派生 sideagent 观察 Claude 输出的 mod。官方博客还演示了如何从空文件夹构建一个 mod,并展示两个更完整的 mod 案例。
Muse 宣布推出 Muse Gadgets 与 Muse Home Link。Muse Gadgets 是开源 ESP32 固件和 Linux SDK,供开发者制作可与 Muse 配合的硬件;Muse Home Link 是让 Muse 连接电视、音箱等智能设备的硬件,用户可在官网认领。
Apple 宣布将在 Mac 上新增对全盘访问权限的限制,要求用户通过非常明确的主动操作才能授予应用这一权限。Apple 表示,部分开发者使用全盘访问的方式可能让用户面临风险,暴露文件、邮件、信息和浏览历史等内容,并称随着 AI 智能体能力与自主性增强,这类访问带来的风险将大幅上升。Apple 未说明该更新的具体推出时间。
Ethan Mollick 应读者要求,把其文章中关于 Bitter Lesson 的视频上传到了 YouTube。他撰文讨论了自己最低估的 AI 进展——AI 自我组织完成任务的能力,以及这对 Muse、Dots 等智能体意味着什么,并配了一支音乐视频解释为何人们不断重新领悟 Bitter Lesson。
Arena 上线 Agent Arena 帕累托前沿(Pareto frontier)实时结果页面,可在 arena.ai/leaderboard/agent/overall/pareto 查看。该页面展示智能体在整体维度上的实时排名与帕累托前沿分布。
Arena 宣布 OpenAI 的 GPT-6.1 Sol (Max) 进入 Agent Arena 第 5 名,提升 11.23%,并重塑帕累托前沿。其单任务中位成本为 $0.56,比 GPT-6 Sol 低 39% 且得分高 1.52 分,比 GPT-6 Astra 低 81% 且得分差距 1.04 分。
推荐理由:Agent Arena 榜单显示 GPT-6.1 Sol 以更低单任务成本进入前五,读者可据此比较它与 GPT-6 Sol、Claude 系列的性价比差距。
Perplexity 表示期待在 SPACE 上使用 NVIDIA 新款 Vera CPU,NVIDIA 团队已到访并交付该芯片。Perplexity 称其正在构建的许多能力依赖智能体安全可靠地运行更强的代码环境,因此对在 Vera 上测试这项工作感到兴奋。
OpenAI 预告了由 GPT-6 Astra 驱动的 dots,定位为能力出众、始终在线的智能体,可处理各类任务。swyx 提醒外界不要忽略这一"one more thing",并称 OpenAI 在 dots 上已投入一段时间。
Replit 官方账号发文「Go forth and build」,鼓励用户动手构建。有用户回复称,前一天用其 agent 做了一个简单的 CSV 清理工具,并称把这类枯燥的活儿交付出去有种奇特的满足感。
xAI 发布实验性 TypeScript SDK,可通过 `npm install @xai-official/sdk` 安装,在一个 SDK 中调用 Grok 最新模型的文本、语音、图像和视频能力。该 SDK 还支持运行在 xAI 服务器上的工具,包括实时 X 搜索、网页搜索、代码执行和远程 MCP。官方称目前仍处早期阶段,希望开发者反馈以持续迭代。
Cloudflare 发布 Clef 和 Clef-flash 两款面向 AI 智能体的决策模型,返回带概率的简短分类而非长文本,用于路由工单、触发升级或转交人工。
苹果宣布将在 macOS 上对完全磁盘访问权限引入额外控制,理由是 AI 智能体增加了这一访问级别带来的风险。该设置原本用于让备份正常工作,但会授予应用访问文件、邮件、消息乃至浏览历史的权限。
ChatGPT 的 Finances 功能开始向美国 Free 和 Go 用户推送,用户可通过 Plaid 和 Experian 安全连接账户,基于自己的财务信息获得回答。
ChatGPT 的 Finances 功能开始向美国 Free 和 Go 用户推送,用户可通过 Plaid 和 Experian 安全连接账户,基于自己的财务信息获得回答。
The Verge 记者 Allison Johnson 实测了 OpenAI 本周发布的智能体平台 Dots,它拥有拟人化头像和可自定义名称,界面与 Meta Muse 类似,可让智能体在虚拟机中操作 Blender、GIMP 等应用,并可通过桌面版 ChatGPT 应用访问用户自己的电脑。
Peter Steinberger 表示 DevDay 上他最喜欢的幻灯片是一张“一人对多智能体”的架构图,并称赞了团队。该图被网友形容为智能体版的族谱,也有人称这正是他所设想的智能体工作流。相关回顾视频预计还需数周才能上线。
Ben Horowitz 在 Databricks 论坛上分享,有人称其使用 Muse 这类个人智能体最大的成就是成功取消了《纽约时报》订阅。发帖者表示自己打算也试一试。
Cursor 推出 Rollouts,可编写监控计划并在部署过程中持续观察变更,在用户感知前捕获回归问题。一旦发现回归,它会定位肇事的 PR 并自动开启 issue,一键即可启动云智能体进行修复。Rollouts 使用额度免费包含至 10 月 3 日。
Circuit Breaker Labs 打造模拟不同年龄、背景、语言和文化用户的 AI 智能体,对模型进行红队测试,每天运行数万至数十万次模拟交互,以检测危险的心理有害互动,并用专有评分方法生成可审计、可解释的分数。
研究提出 EgoTools,聚焦真实第一视角视频中的工具中心推理,解决多数智能体演示忽略的"手中持有什么工具、如何使用"问题。该工作关注跨镜头切换时的工具身份保持,作者称首次尝试在镜头移开的瞬间就丢失了螺丝刀。论文已发布在 HuggingFace,编号 2609.39378。
Trillium Labs 作为一家新非营利组织正式亮相,致力于推动前沿 AI 的开放科学,将构建开放的后训练配方并扩展至开放基础设施,研究 RSI、reward-hacking 和多智能体系统。
OpenCode 宣布 inclusionAI 的最新模型 Ling-3.1-flash 在其平台免费开放,该模型为 560B 总参数、25B 激活参数、262K 上下文。评论区集中追问是否有基准测试、编码表现如何、免费是否有每日用量上限以及会持续到什么时候。
Google Research 发布多智能体证明发现论文,其系统 Cogentic 基于 Gemini,从问题陈述出发、无需专家提示,在理论计算机科学的五个开放问题上取得新结果,涉及在线学习、拍卖理论和机制设计,每个结果均由领域专家核验。
蚂蚁百灵发布 Ling-3.1-flash,总参数约 560B、每 token 激活约 25B,支持最高 1M token 上下文,并计划近期开源。该模型已在 OpenRouter 免费上线,官方称其在 GDPVal-AA v2.1 上取得 1,673 Elo、FrontierSWE 75.16、HealthBench Professional 65.35。
推荐理由:官方给出 Ling-3.1-flash 的参数量、上下文与多项基准成绩,可据此判断其编码与智能体能力定位。
ElevenLabs 已获得 FedRAMP 20x Class A 认证,覆盖 ElevenAgents 及 Text to Speech、Speech to Text API,需在 Zero Retention Mode 与美国数据驻留条件下运行。
PixVerse 插件支持将产品创意转化为开箱视频,用户只需描述产品、场景和出镜者的反应,AI 智能体即可调用 PixVerse 生成视频。
MIT Technology Review 报告指出,企业 AI 的规模化瓶颈是结构性的,全球 AI 投资 2026 年将达 2.5 万亿美元、同比增长 44%,但多数企业仍未靠 AI 增长收入。报告称领先企业把流程重设计置于模型选型之前,并强调数据就绪而非数据规模,主张以主权、可组合的架构在数据原地查询与准备数据,供 AI 智能体直接行动。