Anthropic 为 Claude Code 推出 mods 扩展机制
Anthropic 的 Thariq 宣布 Claude Code 支持 mods,可改变行为、定制 UI、替换功能,用几行 TypeScript 编写或由 Claude 生成。mods 随插件分发,在 CLI 或桌面应用里用 /plugin 安装,作者举例 next-steps 可给出下一步建议并选择技能与命令,也可派生 forked agents 做额外工作。
Anthropic 的 Thariq 宣布 Claude Code 支持 mods,可改变行为、定制 UI、替换功能,用几行 TypeScript 编写或由 Claude 生成。mods 随插件分发,在 CLI 或桌面应用里用 /plugin 安装,作者举例 next-steps 可给出下一步建议并选择技能与命令,也可派生 forked agents 做额外工作。
Anthropic 员工 Thariq 介绍 Claude Code 新增 mods 能力,用户可以改变其行为、定制 UI、替换成自己的功能,用几行 TypeScript 编写或让 Claude 代写。
Claude Code 社区插件 next-steps 可为用户推荐下一步操作,包括选择技能和其他命令。安装方式为执行 `claude plugin marketplace add anthropics/claude-plugins-community` 和 `claude plugin install next-steps@claude-community`。
Thariq(@trq212)正在为下一篇面向企业领导者的文章征集素材,主题是如何应对 AI 编程智能体带来的变化。他询问读者希望管理层理解智能体的哪些方面,以及正在经营公司的人遇到了哪些问题。
Karpathy 分享理解大语言模型输出的提示词技巧,包括要求模型用 ASD-STE100 受控语言写作,或提出 80% 接近该规范以降低严格程度。他还建议让模型生成图表、HTML 交互网页,以及用 ElevenLabs API key 配音的 3b1b 风格讲解视频。他认为随着模型变强,工作会更多上升到监督与理解层面,可以索取以往不划算的大型定制一次性软件产物。
一位开发者借助 Claude 学习动画制作并查找参考,让 Claude 搭建了一个动画编辑器,用于反复迭代游戏原型中的跳跃动画,并放出了对比视频。他强调这是个人副业项目,认为做游戏的过程本身极具创造性,不应外包给 AI,而应让 AI 配合自己实现构想。
Tibo(@thsottiaux)表示,由于 primary dot 当前用量近乎无限,他无法提供重置,需要尽快想出新的方案。
OpenAI 的 Tibo 发布 Dots 演示视频,称这次"WiFi 更好",但评论区大量用户质疑演示翻车并非网络问题。多位用户反馈 Codex 语音功能已异常数周、Dots 可靠性很差,还有人抱怨 ChatGPT iPhone 应用无法登录、Sol 6.1 速度极慢。
OpenAI 的 Tibo 宣布,将于明日 10am PST 为所有付费 ChatGPT 账号进行全球额度重置。他同时为 GPT-6.1 Sol 上线初期的缓慢表现致歉,称在头两天遭遇大规模流量高峰后,该模型现已恢复到预期速度。
dot 支持通过提示词"create a pet and set it as your avatar"创建宠物并直接设为头像,宠物可基于一个想法、一张图片或几乎任何素材生成。
Tibo 的未读邮件已从超 9000 封降至 6110 封,计划在 48 小时内借助 clean filters 实现收件箱清零,Dot 已接受这一挑战。他还演示了可以让自己的 dot“create a pet and set it as your avatar”,宠物可基于一个想法、一张图片或几乎任何内容生成。
OpenAI 员工 Tibo 表示,所有付费 ChatGPT 账号的额度重置将于明天上午 10 点(PST)全球落地。他同时致歉称 GPT-6.1 Sol 上线初期因前两天流量激增而速度偏慢,目前已恢复预期速度。
Tibo(@thsottiaux)表示,在这个小世界里 dots 的数量已经超过 bots,且团队每天都在改进它们,它们会直接从用户反馈中学习。
ScienceBuddy 将用户在对话中的纠正转化为带评分的测试任务,交替改写智能体的提示词与技能、重训模型,把科学智能体准确率从 42.2% 提升到 73.3%。
一项针对中等长度、定义明确的会计任务的研究发现,前沿 AI 模型比初级会计师更快更准确,甚至优于研究中表现最好的会计师。Claude Opus 5 在 20 道题中取得 20 题全对、正确率 100%,每题几分钟内完成;12 名持证注册会计师的正确率从 0% 到约 90% 不等,其中数人用完了 3 小时时限。研究还提到,18 个月前这些模型在同类任务上的得分远低于人类会计师。
伯克利论文《When Context Changes: Understanding Update Failures in LLMs》发现,当偏好或截止时间等发生变化时,旧版本仍留在上下文中,模型虽掌握新值,注意力却持续漂回旧提及。
Blackstone 总裁兼 COO Jon Gray 此前已提出,会计、法律、金融等规则型业务将被 AI 彻底颠覆,JPMorgan 已用 AI 取代代理顾问处理股东投票。一则对比显示,Claude Opus 5 在 20 项任务中全部以 100% 正确率完成且每项仅需数分钟,而 12 名持证 CPA 的正确率从 0% 到约 90% 不等,多人耗尽 3 小时时限。
科技分析师、前 a16z 合伙人 Benedict Evans 指出,AI 可能自动化初级律师、咨询顾问、银行家和广告从业者的大量常规工作。他认为,金字塔底层岗位的工作内容将面临冲击,而没在律所或 Bain、BCG、McKinsey 工作过的人很难真正理解这些工作如何运转。
NVIDIA 新论文测试 7 个开源模型在加数字、排序列表等简单重复任务上的表现,128K token 任务的平均准确率比 4K token 任务低 62.8%,最好的模型在最长的任务中也只有 17.1% 全部答对。
腾讯论文提出 SkillAdam,让 AI 自动改进智能体技能指令时记录已修复的问题,并在效果不稳定时只做小幅修改。在长程购物与旅行规划任务上,它平均准确率达 28.3%,高于此前最佳方法 SkillOpt 的 21.7%,token 用量约为后者的三分之一。该方法针对自动改写指令常陷入反复、新改动推翻已有修复的问题。
Tavus 推出视频到视频模型 Griffin 的研究预览版,面向实时面对面对话,可从对话中学习交流行为,在对话中边看边听,能中途插话或在有人进入画面时作出回应。
纽约大学 Stern 商学院教授 Aswath Damodaran 称,AI 若成功,其 10-15 万亿美元的可触达市场"很可怕",因为这一规模只有在 AI 取代人类工作、而非仅作为工具时才会出现。他指出,若该故事成真,半数白领将失业,随之而来的是收入与人生意义的双重丧失。
Tavus 推出视频到视频模型 Griffin 的研究预览,面向实时面对面对话,可在对话中观看和聆听,并能在对方说到一半时打断或对进入画面的人作出回应。
Arceus 成立了一家由 AI 智能体与持证律师协作的律所,端到端处理 MSA、DPA、NDA、订单和供应商协议的审查、修改、起草与谈判,客户可直接从 Slack 提交合同。每份合同人工审查平均耗时 4 到 6 小时,无内部法务的初创公司可在数小时内收到红线修改稿,且每项工作采用客户事先确认的固定价格。该公司以 1700 万美元融资启动,由 GreyCraft 领投。
Arceus 推出一家结合 AI 智能体与执业律师的律所,面向初创和成长期公司处理商业合同,可端到端审查、修订、起草和谈判 MSA、DPA、NDA、订单表单和供应商协议。
Cathie Wood 在 ARK Invest 视频中解释 AI 领域的杰文斯悖论:同样的回答每年成本下降 99.99%,但调用量爆炸式增长。即便价格暴跌,OpenAI 的年化收入仍在约一年内从 $20B 升至 $70B,超过 Anthropic 报告的 $65B。她认为更便宜的调用没有压缩业务,反而成为 GDP 爆发式增长的引擎。
Grok 4.7 正在 Grok 网页端和移动端推送,并成为所有模式的基础模型,包括 Fast、Expert、Build 和 Heavy。该消息由 Testing Catalog 转述,称其已进入 App。
论文 AgentBug-Smith 提出自动复现智能体系统中真实 harness bug 的方法,指出这类 bug 具有独特特征,当前最先进的软件智能体仍难以修复。现有 benchmark 也进一步阻碍了该方向的进展。
Grok Bot 正在逐步推送 Primary Bot 功能,用户需配置一个新的 Primary Bot 或选择一个已有 Bot 作为 Primary,例如把 Chief of Stuff 设为 Primary。Primary Bot 定位为主 AI 助手,可以管理其他 Bot 并主动给出建议,相关入口已出现在最新 iOS 应用中。
美中多家实验室的论文提出 AgentBug-Smith,把 GitHub 上智能体框架的真实 bug 报告自动转成可运行测试,形成一套 200 个 bug 且持续增长的基准。
Grok Bot 新增 Primary Bot 功能,开始具备主动性,可自行给出建议。用户需要配置一个新的 Primary Bot,或从已有 Bot 中选一个作为 Primary,例如把 Chief of Stuff 设为 Primary。该功能正在逐步推送,Bot prime 已出现在最新的 iOS 应用中。
Anthropic 为 Claude Code 推出 Mods,用户可借此改写或替换 Claude Code 的行为,甚至绘制自定义 UI。Mods 底层是 hooks,随插件分发,每个是一个运行在会话中的小型 JavaScript 或 TypeScript 模块,可实时看到每个事件,并可通过 Claude Directory 分享给他人。
国际清算银行(BIS)发布关于 AI 公司循环融资的报告,2021 至 2025 年间同行贡献了 AI 公司投资额的 55.2%,AI 投资者自身交易额的 28.7% 流向 AI 标的。
Black Forest Labs 发布 FLUX 3 Image,一款支持 4K 精确编辑的新图像模型。用户已可在 Tools Playground 中试用新功能,开放权重计划在未来几周内发布。
国际清算银行(BIS)发布关于 AI 公司循环融资的报告,2021 至 2025 年间 AI 企业获得的投资中 55.2% 来自其他 AI 公司,而 AI 投资方投出的资金中只有 28.7% 流向 AI 企业。
Grok 4.7 正在 Grok 网页版和移动端推送,成为 Fast、Expert、Build、Heavy 全部模式的基座模型,并上线 Google 的 Gemini Enterprise Agent Platform;Grok Bot 逐步转向主动建议,Grok Build 新增 /dashboard 智能体面板。
Volantis 完成 8800 万美元 A 轮融资,由 Lachy Groom 和 Abstract 联合领投,John Doerr、Susa Ventures、VXI Capital、Triatomic Capital 参投,Jeff Dean、Dwarkesh Patel、Naveen Rao、Sholto Douglas 以天使身份加入。
Volantis 完成 8800 万美元 A 轮融资,由 Lachy Groom 和 Abstract 联合领投,John Doerr、Susa Ventures、VXI Capital 和 Triatomic Capital 参投。
DeepSeek Harness v0.2 是一款由 DeepSeek 模型驱动的桌面应用,现已登陆 macOS、Windows 和 Linux,可执行工作与编码任务,并开箱支持 Plugins 和 Workspaces。
Gemini 桌面端一项设置显示,其 Computer Use 能力将扩展到选定文件夹之外,并支持联网访问和跨应用操作,且无需每一步都获得批准。该功能目前仍处于测试阶段。