跳到正文
原文
X:AK (@_akhaliq)· @HuggingPapers·· 3 天前AI 评分48

AREX-2:用长时程反思任务推进自我改进智能体,27B 模型在 MLE-bench Lite 达 81.8

RT by @_akhaliq: AREX-2: Advancing Self-Improving Agents through Long-Horizon Reflective Tasks A 27B agent that turns more test-time rounds into better solutions, trained on verifiable ML and algorithmic tasks. Achieves 81.8 on MLE-bench Lite, 70.7 on Frontier-CS, and transfers to deep research.

AI 导读

AREX-2 是一个 27B 智能体,通过长时程反思任务实现自我改进,在可验证的 ML 与算法任务上训练,测试时轮次越多解越好。它在 MLE-bench Lite 上取得 81.8,在 Frontier-CS 上取得 70.7,并可迁移到深度研究任务。

来源:X:AK (@_akhaliq) · x.lingyaoai.com