跳到正文
原文
rohanpaul_ai· @rohanpaul_ai · X·· 1 天前AI 评分66

Apple 论文:强编码智能体自主做 ML 工程,最小 harness 表现最好

AI 导读

Rohan Paul 转述 Apple 新论文,指出自动 ML 工程的进展来自模型与运行时而非外围脚手架。论文用同一代码库、模型、硬件和 24 小时预算重跑各种封装,发现一个带 shell 和文件访问的单一编码智能体匹配或超过 4 个多智能体 ML 系统,给模型 shell 而非聊天框是唯一明显起作用的改动。

正文 · AI 翻译

苹果的这篇新论文基本上指出,自动化机器学习工程方面的进展主要来自模型和运行时本身,而不是围绕它们构建的脚手架。

研究发现,一个提示得当、拥有 shell 和文件访问权限的编码智能体,其表现就能匹敌甚至超越 4 个多智能体机器学习系统,因此不必搞复杂的编排,直接从单个会话开始即可。

那些系统增加了搜索树、记忆层和专家智能体团队。

它们的设计前提是模型只能写代码,而不能运行代码。

这篇论文用同一个模型、同样的硬件和 24 小时预算,在 1 个代码库上重新运行了所有这些封装框架。结果表明,唯一明显起作用的改变,就是给模型一个 shell 而不是一个聊天框。

在 GLM 5.2 上,最简智能体在 62.5% 的 Kaggle 任务中获得奖牌,而表现最好的已发表框架只有 47.1%。加入并行智能体和消息通道后,其奖牌率反而从 55.7% 下降到了 33.3%。

– arxiv. org/abs/2609.40303

标题:《强智能体进行自主机器学习工程需要多复杂的框架?》("How Much of a Harness Does a Strong Agent Need for Autonomous ML Engineering?")

来源:rohanpaul_ai · x.com