ChatGPT 应用内出现标记为“Coming Soon”的 Wallet 功能
ChatGPT 应用内出现一个标记为“Coming Soon”的 Wallet 功能,时间点几乎与 World 应用更名为 World Money 并转型为实际钱包同步。该 Wallet 很可能用于 Dots 的智能体购物。World 由 Sam Altman 联合创立,通过 World ID 提供“人类证明”并内置加密钱包。
ChatGPT 应用内出现一个标记为“Coming Soon”的 Wallet 功能,时间点几乎与 World 应用更名为 World Money 并转型为实际钱包同步。该 Wallet 很可能用于 Dots 的智能体购物。World 由 Sam Altman 联合创立,通过 World ID 提供“人类证明”并内置加密钱包。
swyx 转发呼吁支持小型创作者,并推荐 Latent.Space 播客对谈 TypeSafe CEO Jev。对谈围绕 System One Model、RLCD、intelligence/$、可靠 AI 以及 chat-first AI 的终结展开,Jev 解释了 AI 能解决极难问题却仍难以自动化基础工作的原因,以及 TypeSafe 为何拒绝公开 benchmark 和 API 层拒绝。
Google DeepMind 推出 Gemini 4 Argon,面向编码、企业知识工作与网络防御,首批开放给 Fairwind 计划的政府用户与可信网络安全人员,后续再向开发者、企业和消费者开放。
推荐理由:汇总了 Gemini 4 Argon 的基准、定价与可用范围,并列出同期多家模型与工具的动态,便于横向比较。
密码学者 Matthew Green 在文章《Is sandboxing sufficient to contain rogue agents?》中提出,蠕虫由两半组成:劫持智能体的载荷,以及把载荷传给下一个智能体的智能体。
ChatGPT 现在可以直接构建和部署 MCP 服务器,并限制访问范围或公开分享。ChatGPT Sites 新增托管 MCP 服务器能力,支持插件扩展,用户通过 @sites 指令即可创建带扩展的 MCP 服务器、部署到 Sites、转为插件并自动安装到网页、移动端和桌面端。作者称 ChatGPT 正在成为任何人都能按需定制的可塑软件。
OpenAI 的 Sherwin Wu 认为,ChatGPT 已开始在对话中推荐插件,而每天数百万个提问尚无插件可推荐,每个都是空位。他建议开发者找人们已在 Google 搜索或每周手工完成的工作流(如 PDF 转 Excel、发票生成器、客户周报),将其做成 ChatGPT 插件,并用用户实际输入的措辞撰写描述,先上线 5 个再押注数据最好的那个。
OpenClaw 的 The ClawCast 第 12 期邀请 TypeSafe AI 的 Allie Laabs、OpenAI 的 Kevin Lin 与 OpenClaw 的 Josh Lehman,围绕 Jev 与决策模型展开讨论。OpenAI 的 Kevin Lin 稍后加入,探讨智能体在职场中的应用。节目可在 openclaw.ai/podcast/episode-12 观看或收听。
DeepSeek Harness 发布 v0.2 预览版,桌面应用现已支持 macOS 和 Windows,可按官方给出的安装说明开始使用。作者同时宣布 DeepSeek Harness 已开设官方 X 账号 @DeepSeekHarness。
Peter Steinberger 表示自己虽在体验 Grok Bot、Muse 和 Dots,但并未停用 OpenClaw,仍用一台专用 Mac Mini 运行它,并称其比以往更好用。
Google DeepMind 的 Gemini 4 Argon 将长程推理用于代码迁移、内存优化和安全防御,目前通过 Fairwind 向受信任的网络防御者逐步开放。Anthropic 从任务、环境与成本三个层次评估机器人就业影响,发现经济上划算的工作仍很少。ElevenLabs 推出表达型 Eleven v4 与低延迟 Turbo,覆盖语气、多说话人互动与跨语言声线一致性。
一位用户称自己现在几乎只在 Claude Projects 里工作,并总结了几个特点:主聊天负责管理线程、默认低强度运行,线程承担大部分工作、默认使用 Opus 5.5 和中等强度,且每个线程都是完整的 Claude,可单独对话。
latent.space 播客中,OpenAI 的 @AriX 和 @nikunjhanda 介绍了 OpenAI 的新智能体栈,包括 Computer Use、Dots、Decisions API、UltraFast 以及 AI 云。
fal CTO @gorkem 在 GenMedia Conference 上表示,生成式媒体已达到“token market fit”,专业人士如今整日坐在电脑前用 AI 生成视频。他指出,AI 市场中只有编程智能体和视频生成能让单个用户高效消耗如此大量 token,这是过去一年生成式媒体最大的变化。
Omni-IO Skills 是一篇关于让 AI 智能体实现 Omni-Native 能力的论文,已在 Hugging Face 上线(论文编号 2609.31847)。该工作聚焦于为智能体赋予全模态输入输出技能,具体方法与结果细节尚未在公开信息中展开。
Anthropic 上线面向 Claude 开发者的新站点 Claude.dev,发布工程深度文章、Claude Code 和 API 使用指南及团队经验分享,文章分为智能体、工程、实战手册、技能四类。
LEGO-Anything 提出用编码智能体(Coding Agents)完成 3D 场景重建,论文已发布在 Hugging Face Papers(编号 2609.36380)。该工作将 3D 场景重建任务交给编码智能体处理,并附有演示视频。
Latent Space 在 OpenAI DevDay 后采访了负责 Computer Use 产品与工程的 Ari Weinstein 和 API 产品负责人 Nikunj Handa。
新发布的 Incident Arena 是一个把编程智能体放到"on call"位置的基准测试,用来检验 AI 能否处理应用代码出故障后的运维响应,而不只是写代码。该基准同时放出了论文与完整数据集。
Google 宣布推出 Gemini 4 Argon,称其为面向真实世界编码、企业知识工作和网络防御的前沿模型,即将逐步上线。Demis Hassabis 表示团队为此投入了大量工作,更多信息见官方博客。
Arena 公布 Google DeepMind 的 Gemini 4 Argon (High) 在 Text Arena 以 1525 分排名第 1,在 Code Arena: WebDev 以 1679 分排名第 8,在 Agent Arena 以 +7.92% 净提升排名第 8,每任务成本 0.62 美元。
推荐理由:Arena 公布了 Gemini 4 Argon (High) 在 Agent Arena 与 Text Arena 的排名和成本数据,可据此比较其与 Gemini 3.8 Flash、Claude Opus 4.6 的差距。
Cognition 宣布成为首个运行 NVIDIA Vera Rubin 的客户,由 CoreWeave 提供支持。在 SWE-2 推理上,新芯片在相同解码速度下 token 吞吐量约为 GB200 的 4.8 倍。Cognition 称更多算力意味着更好的智能体。
Runway 首席产品官 Anthony Maggio 登台发布 Runway Ads,一款面向效果营销的全新自主引擎。该产品已开放早期访问申请,详情见 runway.com/product/ads。
Gemini 4 Argon 已发布,官方表示在消费端将先向 AI Ultra 计划用户开放,随后轮到 AI Pro 订阅用户。目前该模型尚未向普通用户开放,评论区多位用户反映自己的账号仍停留在 Gemini 3.6 Flash。官方称一旦获得全部许可就会尽快推送。
Google 表示 Gemini 4 Argon 智能体已在其数据中心释放超过 300 TiB 内存,输出上限为 100 万 token,并已在优化其自身基础设施。
Tibo(@thsottiaux)让 dot 为自己画肖像,首次结果偏卡通,随后要求它更努力并上网找一张他的近期照片,结果明显更好。他随后在 dot 的电脑上点击查看该结果。
Artificial Analysis 评测显示,Google DeepMind 的 Gemini 4 Argon 在高推理档位下于 Artificial Analysis Intelligence Index 得分 53。
Google 发布 Gemini 4 Argon 模型,宣称在编码、知识工作和网络安全方面具备行业领先性能,但目前仅限公司内部有限测试,外部用户尚不能使用。
Google 发布 Gemini 4 Argon,官方称其为面向真实世界编码、企业知识工作和网络防御的前沿模型,即将逐步开放。Google 员工 Logan Kilpatrick 表示该模型由 Google 内部多方协作完成,目前只是开始,期待更多人使用。
Google 发布新前沿模型 Gemini 4 Argon,主打在复杂长周期工作流中维持深度推理,覆盖真实软件工程、法律与金融等企业知识工作以及网络安全防御场景。该模型的输出 token 上限扩展至 1M tokens。Argon 目前正面向 Fairwind Program 中的一批受信任网络安全防御者逐步开放,后续将尽快扩大可用范围。
推荐理由:官方给出 Gemini 4 Argon 的定位与 1M 输出 token 上限,可据此判断长流程任务的能力边界。
Google 宣布推出新前沿模型 Gemini 4 Argon,面向复杂长周期工作流,主打持续深度推理,覆盖真实软件工程、法律与金融等企业知识工作以及网络安全防御场景。该模型输出 token 上限扩展至 1M tokens,目前正通过 Fairwind Program 向一批受信任的网络安全防御者开放,后续将尽快扩大可用范围。
推荐理由:Google 公布 Gemini 4 Argon 的定位与 1M 输出 token 上限,可据此了解前沿模型在长周期工作流上的方向。
Google 发布 Gemini 4 Argon,称其在真实软件工程、知识工作和网络安全防御等复杂工作流中提供前沿性能,并具备 1M token 输出上限。
推荐理由:Google 官方公布 Gemini 4 Argon 的定位与 1M token 输出上限,可据此了解其面向复杂工作流的规格变化。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,面向编码、企业知识工作和网络安全防御等复杂工作流。该模型今天起通过 Fairwind Program 向一批受信任测试者开放。
Google 发布 Gemini 4 Argon,定位为面向真实场景编码、企业知识工作和网络防御的前沿模型。Sundar Pichai 表示 Argon 具备前沿安全防护,今日已交付美国政府并通过 Fairwind Program 提供给一批受信任的网络防御方,后续将尽快且尽可能安全地开放。他称会有更多内容发布,迭代速度会很快。
推荐理由:Google 官方披露 Gemini 4 Argon 的发布节奏与安全部署路径,读者可了解其面向编码与网络安全的能力定位。
Google 提前预览下一代模型 Gemini 4 Argon,称其在复杂工作流、网络防御和软件工程上达到前沿水平。Google 内部团队已广泛使用该模型,覆盖编码到量子计算等场景,反馈良好,并给出了基准测试结果。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御者开放,随后将逐步面向开发者、企业和消费者推出,起步价为每百万输入 token 2 美元、每百万输出 token 10 美元。
推荐理由:Gemini 4 Argon 的 1M 输出 token 与多项基准成绩,展示了长程复杂任务上的能力边界变化。
Grok Bot 面向软件开发的能力增强,机器人可以把编码任务交接给 Cursor,并通过 GitHub 和 Origin 插件管理 PR,还能分享所构建内容的视频演示。作者同时给出 x.ai 机器人市场中的工程类机器人入口。
xAI 将工程团队的 Bots 作为可安装模板分享到 Grok Bot Marketplace,每个模板自带 skills、routines 和 connectors,方便用户直接上手。模板页面位于 x.ai/bot/marketplace/engineering。
Grok Bot 宣布在软件开发方面能力增强。Bot 可以把编码任务交给 Cursor,通过 GitHub 和 Origin 插件管理 PR,还能分享所构建内容的视频演示。
OpenAI 发布新报告,探讨小企业如何将 AI 智能体用于寻找客户、构建产品和管理财务。OpenAI 同时宣布与 ASBDC 建立新合作,为小企业主提供实操 AI 培训和本地指导,帮助他们上手使用 AI。
Ethan Mollick 指出,各公司的客服智能体即将被 Dots & Muses 等 AI 智能体淹没,它们通过语音/聊天为用户争取更优价格。人们把这类工作交给智能体并省下钱的案例正在涌现,并将愈发病毒式传播。这些智能体可使用为人类搭建的渠道,忍受电话树、等待接通或被拒后反复重试。