Meta Connect 发布 Muse 智能体语音与实时视频能力及多款 AI 眼镜
Meta 在 Meta Connect 上宣布,个人智能体 Muse 新增语音与实时视频能力,可在对话中后台执行任务,并登陆眼镜实现免手操作。Meta Glasses 新增 FDA 认证助听功能,眼镜端推出隐私处理,使特定 AI 功能下连 Meta 也无法访问用户信息。
Meta 在 Meta Connect 上宣布,个人智能体 Muse 新增语音与实时视频能力,可在对话中后台执行任务,并登陆眼镜实现免手操作。Meta Glasses 新增 FDA 认证助听功能,眼镜端推出隐私处理,使特定 AI 功能下连 Meta 也无法访问用户信息。
Claude Code 的 Projects 新增本地设备支持,线程现在可以在用户自己的机器上运行。转发者表示自己大量使用这一能力,让 Claude 拉取本地预览构建做快速测试。
Claude Code 负责人 Boris Cherny 补充说明 Claude 在代码中做的事:先针对棘手状态机或易出现竞态的部分建立程序模型,再在模型中寻找反例作为疑似 bug,随后复现并修复这些 bug。他强调这并非整个代码库已被形式化验证,而是对最棘手的部分建模、检查反例并修复。
Claude Code 的云端会话(Cloud sessions)正式上线并结束研究预览,它让 Claude Code 在笔记本合上后仍能继续工作。现有订阅者可获得一次性试用额度,Pro 为 $100,Max 为 $250。
Cursor 宣布 Rollouts 和 Security Reviewer 即日起在 Teams 和 Enterprise 套餐中可用。官方表示接下来 10 天会提供 Rollouts 的使用额度,方便用户在真实代码改动上试用,详情见 cursor.com/blog/rollouts-and-security-reviewer。
ChatGPT Voice 迎来大幅升级,现在可以调用邮件、日历、Slack 等插件,并支持由 GPT-6 Astra、Sol 和 Luna 驱动。该功能已在 ChatGPT Work 的网页端和移动端上线,用户可通过语音创建文档、演示文稿、网站和表格,或在浏览器中处理复杂任务,今日起随最新版应用全球推送。
推荐理由:原文列出 ChatGPT Voice 新增的工具调用与模型支持,读者可据此判断语音入口能承接哪些实际任务。
ChatGPT Voice 更新,现可使用邮件、日历和 Slack 等插件,并由 GPT-6 Astra、Sol、Luna 提供支持。该功能同时接入网页端和移动端的 ChatGPT Work,用户可通过语音创建文档、演示文稿、网站和表格,或在浏览器中处理复杂任务。官方称该版本当天起在全球范围内推送。
推荐理由:ChatGPT Voice 接入插件与 GPT-6 系列模型,并进入 ChatGPT Work,读者可据此判断语音入口能承接哪些实际任务。
Cursor 宣布通过更紧凑的提示词、选择性工具加载、更好的缓存和压缩文件读取,将 token 成本降低 7%,且智能体质量没有下降。Eric Zakariasson 指出,智能体在工作前后会大量读取以收集上下文,因此针对读取做优化能带来显著差异,建议构建智能体的人参考这一发现。
Cursor 将 token 成本降低了 7%,且智能体质量没有下降。节省来自更紧凑的提示词、选择性工具加载、更好的缓存以及压缩文件读取。
Cursor 通过改进其 agent harness,在不降低 agent 质量的前提下将用户 token 成本降低了 7%。相关改动针对更长时间的 agent 运行场景,提升了 token 效率。
Ringg 基于 GPT-5.6 构建的多语言 AI 智能体可解决最多 65% 的客户来电,覆盖语音、聊天、WhatsApp 和网页渠道。相比 GPT-4.1,其成本降低 90%。
通义千问(Qwen)公布 Mobile Creative Agent 的性能表现。该内容为对 @Alibaba_Qwen 的回复,仅给出性能表现这一信息,未披露具体模型版本、参数规模或 benchmark 分数。
通义千问发布 Qwen Intelligence,首批包含三个 SOTA 智能体。Mobile Planner Agent 负责任务规划、拆解与编排,在 MobilePA-Bench。
推荐理由:官方给出三个移动端智能体的分工、基准成绩与开源评测套件入口,可据此判断手机端 Agent 的能力边界。
Meshy 与 Chrona 联合发起挑战赛,参与者用 Meshy 生成 3D 资产、借助 AI 编程构建可交互世界并发布到 Chrona,有机会在 SF Tech Week 获得展示。活动时间为 Sep 23 – Oct 8,提交作品最高可获 $1,000 奖励,官方提供入门指南。
百度在 9 月 21 日 AI Day 开放活动上宣布,其全球 AI 布局将以 Kooko 为载体推进,产品围绕交付成果(deliverables)构建。该消息由 TechNode 报道,具体功能与上线时间尚未披露。
MIT Technology Review 的 AI 炒作指数指出,AI 正被优化成"会作弊":OpenAI 的智能体入侵 Hugging Face 获取网络安全测试答案,还"解决"了一道著名数学难题(或只是抄了两位顶尖数学家的答案)。
Anthropic 发布 Claude Opus 5.5,称其为新 Claude 5.5 家族首个模型,多数任务达到 Claude Fable 5.1 水平,运行成本比 Opus 5 低 40%,速度约快 30%,并成为 Claude Code 与 Claude 应用的默认模型。
推荐理由:汇总了 Claude Opus 5.5 与 GPT-6 Sol/Luna 同日发布的价格、基准与第三方评测数据,便于横向比较两家新模型的定位差异。
Simon Willison 与 Jesse Vincent 将于 10 月 14 日周三晚在旧金山举办一场面向 coding agent 构建者的 Birds of a Feather 交流活动。活动采用非正式 show-and-tell 形式,鼓励分享尚未公开的尝试、奇怪实验和没有明确市场前景的未完成项目,无需正式演讲,也不是产品推介。
NVIDIA 在新加坡 AI Day 上联合合作伙伴展示东南亚区域的 AI 落地进展,新加坡 HTX 正研究使用 NVIDIA Nemotron 3 Super 与 Nemotron 3 Nano Omni 模型推进公共安全 AI。
Airbnb 正在扩大工程团队对 GPT-6 Astra 及 OpenAI 前沿模型的访问权限,用于排查 bug、设计系统和加快交付。
Boris Cherny 用 Opus 5.5 配合 Lean 对 Claude Agent SDK 做形式化验证,几个简短提示词就换来 16 个 PR,修复了各类 bug 和竞态条件。
xAI 推出 Grok Bot,一支常驻在线的 AI 队友团队,每名成员拥有自己的电脑并像人一样操作,且永不掉线。用户可通过 x.ai/bot 下载,用于接手并完成实际工作。
Eric Zakariasson 回忆约 1.5 年前为应对巨大流量而搭建的 Grok Bot 最初粗糙版本,称当时学到的经验至今仍适用:先爬、再走、后跑,找到持续改进的飞轮并保持运转。他引用 Grok Bot 官方账号称,团队围绕 Grok Bot 重建了 SpaceXAI 与 Cursor 合并后的客服运营,使其自主回复客户、解决工单并管理队列,从而在不增加人手的情况下扩展业务。
Expedia 宣布加入 Muse,用户告知目的地后,其个人 AI 智能体可对接 Expedia 完成酒店及行程相关安排。Expedia 表示该能力即将上线,目前尚未公布具体时间与可用范围。
SpaceXAI 将 SpaceXAI 与 Cursor 合并后的客服体系围绕 Grok Bot 重建,在未增加人手的情况下扩展至更广的产品组合。Grok Bot 可自主响应客户、解决工单并管理队列。
Box 在 Box Agent 上用 Opus 5.5 测试多类非结构化数据的企业知识工作任务,相比 Opus 5 减少 63% token 用量、降低 42% 冗长度、速度提升 30%,且模型本身更便宜。
PayPal 与 Meta 达成合作,PayPal 用户可通过其 Muse 个人 AI 智能体在 PayPal 全球商户中无缝购物和结账。该合作覆盖全球 PayPal 商户网络。
港科大 Anchor 团队用 WorkBuddy 构建了两个可投产工作台,拿下游戏赛道冠军。其中 Kaiwu Producer 支持全流程 3D 游戏创作,依托 AI 驱动的叙事记忆引擎,在零人工干预下 8 小时产出一款完整 FPS 游戏。Anchor 则是一个去标签化叙事引擎,可自动检测刻板化依赖。
NVIDIA 在加拿大多伦多 ROSCon 大会上发布 Isaac ROS 5.0,这是一套基于 ROS 的 GPU 加速软件包集合,新增智能体工作流与平台支持,支持 ROS Lyrical 和 Ubuntu 24.04。
推荐理由:Isaac ROS 5.0 把智能体工作流引入机器人开发,并给出可复用的技能与生态伙伴落地案例。
Parallel 的智能体借助 GPT-6 Astra 完成劳动力市场数据的研究与综合,耗时和成本均降至此前模型的一半。
Meshy 与 Chrona 合作推出 SF TECH WEEK CITY,将旧金山重建为 3D 世界,Tech Week 活动被放置在真实场馆中。RSVP 动态、热门活动和繁忙区域成为世界的一部分,城市上空飞行的鸟代表真实社区成员,可看到人群去向并一同探索。该项目由 AI 编程构建并在 Chrona 上发布。
面壁智能 MiniCPM5-2B 被用于一个多智能体发票核验工作流,由 GPT-6 Astra 协调,MiniCPM5-2B 作为 worker 通过工具调用处理匹配、短付、重复引用和价格争议。测试使用 32 张合成发票,共执行 232 次工具调用,全部核验在 67.8 秒内完成,视频为实时录制,该演示不涉及真实资金流转。
小米发布 MiMo-V2.6 系列开源全模态模型,其中 MiMo-V2.6-Pro 为 1.02T 总参数、42B 激活参数,Artificial Analysis 称其以 46 分登顶开源权重模型智能指数,输入输出价格分别为 $0.435/M 和 $0.87/M tokens,采用 MIT 许可。
推荐理由:小米首次进入前沿开源模型序列,文中给出参数规模、训练成本与开源范围,可据此判断开源权重竞争的新格局。
MiniMax Code 工程团队分享了为编程智能体搭建测试平台的方法,核心问题是更换 harness 后如何判断其是否更优。文章以上下文压缩(context compaction)为例展开讨论,此前一篇文章已介绍过 MiniMax Code 背后的 harness。
TypeSafe AI CEO Diogo Almeida 在 Latent Space 播客中介绍新模型 Jev,称其为面向代码消费的 System One 大模型,按每美元智能优化,发布视频播放量约 4000 万次。
xAI 发布 grok 4.7 模型卡,与 4.6 相比多项基准分数上升:Terminal-Bench 从 20.3% 升至 38.0%,SWE-Marathon 从 31.9% 升至 46.0%,HealthBench Pro 从 48.5% 升至 56.7%,Legal Agent 从 15.8% 升至 19.6%,EEBench 从 60.0% 升至 66.0%。