The Rise of the Automation Engineer:AI 创造的自动化工程师岗位
文章讨论 AI 带来的新岗位"自动化工程师"(Automation Engineer),认为外界过度关注 AI 取代的工作,却很少提及它创造的职位。作者对 AI 的就业影响持乐观态度,认为悲观论调更容易传播、也更容易获得点击。
文章讨论 AI 带来的新岗位"自动化工程师"(Automation Engineer),认为外界过度关注 AI 取代的工作,却很少提及它创造的职位。作者对 AI 的就业影响持乐观态度,认为悲观论调更容易传播、也更容易获得点击。
UniEvo-VL 是一个自进化框架,让单个多模态模型同时充当教师和学生,从自身建设性反馈中学习,在无外部监督下提升图像生成能力。该框架由 AK 在 X 上分享,发布于 10 月 1 日。
一种新的在线策略蒸馏方法通过外推 RL 引发的表征残差,让学生在四组模型对上匹配甚至超越教师模型。该方法将教师视为方向而非终点,代码和 checkpoint 计划发布。
Volantis 宣布完成 8800 万美元 A 轮融资,用光学技术解决 AI 内存瓶颈,将单芯片内存带宽与容量提升数个数量级,实现大模型(>10T)最高 10,000 tps/user 的超快推理和低 $/tok。该方案初期面向编程智能体,把原本数小时的任务压缩到几分钟甚至几秒,其下一代产品已完成流片,目标刷新相关距离上的带宽密度世界纪录。
ARC Prize 公布 2026 年 ARC-AGI-3 Milestone #2 三位获奖者,均开源了各自得分最高的解法:Daniel Franzen 以 27.9% 获 2.5 万美元,Lord Han Solo 以 23.8% 获 7500 美元,Lohit Siriki 以 22.5% 获 5000 美元。
ARC Prize 2026 公布 ARC-AGI-3 Milestone #2 三位获奖者,均开源了各自得分最高的方案。Daniel Franzen 以 27.9% 得分获 $25K,Lord Han Solo 以 23.8% 获 $7.5K,Lohit Siriki 以 22.5% 获 $5K。
ARC Prize 2026 公布 ARC-AGI-3 里程碑 #2 的三位获奖者,均开源了各自得分最高的解法:Daniel Franzen 以 27.9% 获 $25K,Lord Han Solo 以 23.8% 获 $7.5K,Lohit Siriki 以 22.5% 获 $5K。
Anthropic 的 Claude Code 现在支持 mods,用户可以用几行 TypeScript 修改其行为、定制 UI 或替换成自己的功能,也可以让 Claude 代写。
Anthropic 的 Thariq 宣布 Claude Code 支持 mods,可改变行为、定制 UI、替换功能,用几行 TypeScript 编写或由 Claude 生成。mods 随插件分发,在 CLI 或桌面应用里用 /plugin 安装,作者举例 next-steps 可给出下一步建议并选择技能与命令,也可派生 forked agents 做额外工作。
Anthropic 员工 Thariq 介绍 Claude Code 新增 mods 能力,用户可以改变其行为、定制 UI、替换成自己的功能,用几行 TypeScript 编写或让 Claude 代写。
Claude Code 社区插件 next-steps 可为用户推荐下一步操作,包括选择技能和其他命令。安装方式为执行 `claude plugin marketplace add anthropics/claude-plugins-community` 和 `claude plugin install next-steps@claude-community`。
Thariq(@trq212)正在为下一篇面向企业领导者的文章征集素材,主题是如何应对 AI 编程智能体带来的变化。他询问读者希望管理层理解智能体的哪些方面,以及正在经营公司的人遇到了哪些问题。
Karpathy 分享理解大语言模型输出的提示词技巧,包括要求模型用 ASD-STE100 受控语言写作,或提出 80% 接近该规范以降低严格程度。他还建议让模型生成图表、HTML 交互网页,以及用 ElevenLabs API key 配音的 3b1b 风格讲解视频。他认为随着模型变强,工作会更多上升到监督与理解层面,可以索取以往不划算的大型定制一次性软件产物。
一位开发者借助 Claude 学习动画制作并查找参考,让 Claude 搭建了一个动画编辑器,用于反复迭代游戏原型中的跳跃动画,并放出了对比视频。他强调这是个人副业项目,认为做游戏的过程本身极具创造性,不应外包给 AI,而应让 AI 配合自己实现构想。
OpenAI 的 Tibo 发布 Dots 演示视频,称这次"WiFi 更好",但评论区大量用户质疑演示翻车并非网络问题。多位用户反馈 Codex 语音功能已异常数周、Dots 可靠性很差,还有人抱怨 ChatGPT iPhone 应用无法登录、Sol 6.1 速度极慢。
OpenAI 的 Tibo 宣布,将于明日 10am PST 为所有付费 ChatGPT 账号进行全球额度重置。他同时为 GPT-6.1 Sol 上线初期的缓慢表现致歉,称在头两天遭遇大规模流量高峰后,该模型现已恢复到预期速度。
dot 支持通过提示词"create a pet and set it as your avatar"创建宠物并直接设为头像,宠物可基于一个想法、一张图片或几乎任何素材生成。
Tibo 的未读邮件已从超 9000 封降至 6110 封,计划在 48 小时内借助 clean filters 实现收件箱清零,Dot 已接受这一挑战。他还演示了可以让自己的 dot“create a pet and set it as your avatar”,宠物可基于一个想法、一张图片或几乎任何内容生成。
OpenAI 员工 Tibo 表示,所有付费 ChatGPT 账号的额度重置将于明天上午 10 点(PST)全球落地。他同时致歉称 GPT-6.1 Sol 上线初期因前两天流量激增而速度偏慢,目前已恢复预期速度。
Tibo(@thsottiaux)表示,在这个小世界里 dots 的数量已经超过 bots,且团队每天都在改进它们,它们会直接从用户反馈中学习。
ScienceBuddy 将用户在对话中的纠正转化为带评分的测试任务,交替改写智能体的提示词与技能、重训模型,把科学智能体准确率从 42.2% 提升到 73.3%。
一项针对中等长度、定义明确的会计任务的研究发现,前沿 AI 模型比初级会计师更快更准确,甚至优于研究中表现最好的会计师。Claude Opus 5 在 20 道题中取得 20 题全对、正确率 100%,每题几分钟内完成;12 名持证注册会计师的正确率从 0% 到约 90% 不等,其中数人用完了 3 小时时限。研究还提到,18 个月前这些模型在同类任务上的得分远低于人类会计师。
伯克利论文《When Context Changes: Understanding Update Failures in LLMs》发现,当偏好或截止时间等发生变化时,旧版本仍留在上下文中,模型虽掌握新值,注意力却持续漂回旧提及。
Blackstone 总裁兼 COO Jon Gray 此前已提出,会计、法律、金融等规则型业务将被 AI 彻底颠覆,JPMorgan 已用 AI 取代代理顾问处理股东投票。一则对比显示,Claude Opus 5 在 20 项任务中全部以 100% 正确率完成且每项仅需数分钟,而 12 名持证 CPA 的正确率从 0% 到约 90% 不等,多人耗尽 3 小时时限。
科技分析师、前 a16z 合伙人 Benedict Evans 指出,AI 可能自动化初级律师、咨询顾问、银行家和广告从业者的大量常规工作。他认为,金字塔底层岗位的工作内容将面临冲击,而没在律所或 Bain、BCG、McKinsey 工作过的人很难真正理解这些工作如何运转。
NVIDIA 新论文测试 7 个开源模型在加数字、排序列表等简单重复任务上的表现,128K token 任务的平均准确率比 4K token 任务低 62.8%,最好的模型在最长的任务中也只有 17.1% 全部答对。
腾讯论文提出 SkillAdam,让 AI 自动改进智能体技能指令时记录已修复的问题,并在效果不稳定时只做小幅修改。在长程购物与旅行规划任务上,它平均准确率达 28.3%,高于此前最佳方法 SkillOpt 的 21.7%,token 用量约为后者的三分之一。该方法针对自动改写指令常陷入反复、新改动推翻已有修复的问题。
Tavus 推出视频到视频模型 Griffin 的研究预览版,面向实时面对面对话,可从对话中学习交流行为,在对话中边看边听,能中途插话或在有人进入画面时作出回应。
纽约大学 Stern 商学院教授 Aswath Damodaran 称,AI 若成功,其 10-15 万亿美元的可触达市场"很可怕",因为这一规模只有在 AI 取代人类工作、而非仅作为工具时才会出现。他指出,若该故事成真,半数白领将失业,随之而来的是收入与人生意义的双重丧失。
Tavus 推出视频到视频模型 Griffin 的研究预览,面向实时面对面对话,可在对话中观看和聆听,并能在对方说到一半时打断或对进入画面的人作出回应。
Arceus 成立了一家由 AI 智能体与持证律师协作的律所,端到端处理 MSA、DPA、NDA、订单和供应商协议的审查、修改、起草与谈判,客户可直接从 Slack 提交合同。每份合同人工审查平均耗时 4 到 6 小时,无内部法务的初创公司可在数小时内收到红线修改稿,且每项工作采用客户事先确认的固定价格。该公司以 1700 万美元融资启动,由 GreyCraft 领投。
Arceus 推出一家结合 AI 智能体与执业律师的律所,面向初创和成长期公司处理商业合同,可端到端审查、修订、起草和谈判 MSA、DPA、NDA、订单表单和供应商协议。
Cathie Wood 在 ARK Invest 视频中解释 AI 领域的杰文斯悖论:同样的回答每年成本下降 99.99%,但调用量爆炸式增长。即便价格暴跌,OpenAI 的年化收入仍在约一年内从 $20B 升至 $70B,超过 Anthropic 报告的 $65B。她认为更便宜的调用没有压缩业务,反而成为 GDP 爆发式增长的引擎。
Grok 4.7 正在 Grok 网页端和移动端推送,并成为所有模式的基础模型,包括 Fast、Expert、Build 和 Heavy。该消息由 Testing Catalog 转述,称其已进入 App。
论文 AgentBug-Smith 提出自动复现智能体系统中真实 harness bug 的方法,指出这类 bug 具有独特特征,当前最先进的软件智能体仍难以修复。现有 benchmark 也进一步阻碍了该方向的进展。
Grok Bot 正在逐步推送 Primary Bot 功能,用户需配置一个新的 Primary Bot 或选择一个已有 Bot 作为 Primary,例如把 Chief of Stuff 设为 Primary。Primary Bot 定位为主 AI 助手,可以管理其他 Bot 并主动给出建议,相关入口已出现在最新 iOS 应用中。
美中多家实验室的论文提出 AgentBug-Smith,把 GitHub 上智能体框架的真实 bug 报告自动转成可运行测试,形成一套 200 个 bug 且持续增长的基准。
Grok Bot 新增 Primary Bot 功能,开始具备主动性,可自行给出建议。用户需要配置一个新的 Primary Bot,或从已有 Bot 中选一个作为 Primary,例如把 Chief of Stuff 设为 Primary。该功能正在逐步推送,Bot prime 已出现在最新的 iOS 应用中。
Anthropic 为 Claude Code 推出 Mods,用户可借此改写或替换 Claude Code 的行为,甚至绘制自定义 UI。Mods 底层是 hooks,随插件分发,每个是一个运行在会话中的小型 JavaScript 或 TypeScript 模块,可实时看到每个事件,并可通过 Claude Directory 分享给他人。
国际清算银行(BIS)发布关于 AI 公司循环融资的报告,2021 至 2025 年间同行贡献了 AI 公司投资额的 55.2%,AI 投资者自身交易额的 28.7% 流向 AI 标的。