Meta 等机构论文提出智能体 harness 分支化调优与路由方法
Meta、Duke 与加州大学的研究者发布论文,提出把智能体 harness 的自动调优拆成多个专精分支,再按任务路由到最合适的分支,在全部 4 个测试设置中优于 Meta-Harness。
Meta、Duke 与加州大学的研究者发布论文,提出把智能体 harness 的自动调优拆成多个专精分支,再按任务路由到最合适的分支,在全部 4 个测试设置中优于 Meta-Harness。
Meta Superintelligence Labs 的论文发现,预训练 LLM 配上轻量推理框架后可作为有能力的智能体,在测试时预算充足时甚至能超越 RL 后训练版本。
AutoCompact 训练智能体自行决定何时压缩上下文、保留哪些工作状态以及如何恢复。方法先用 judge 审查基础智能体的压缩决策并替换有缺陷的决策,再用修正后的轨迹做 SFT,随后用任务成功奖励做 RL,将编码与压缩一起训练。
Meta Superintelligence Labs 的论文发现,在样本足够多时,带轻量 harness 的基座模型在 BFCL v4 multi-turn、ACEBench 和 WebShop 上解决的智能体任务常多于 RL 后训练版本,后训练版本仅在 pass@1 上占优。
Meta 与合著者提出 Context Language Models(CLM),把上下文作为模型可用 Bash 编辑的文件,由模型决定保留、改写或删除哪些内容。
Meta 提出一种分支化的智能体 harness 优化方法,将 Meta-Harness 式单一搜索路径拆成多个分支,每个分支保留自身 harness 更擅长的开发用例、丢弃所有分支已解决的用例,并依据历史重写自己的提议策略,再由 router 在运行前为每个新输入选择某个分支的 harness。
Meta 与同事的论文提出 Context Language Models(CLM),把上下文作为模型可用 Bash 编辑的文件,由模型决定保留、改写或删除哪些内容。
Meta Superintelligence Labs 提出用专用控制器调度长程智能体任务,在相同 worker 和相同预算下,GPT-5.5 在 ProgramBench 上从 63.7% 提升至 71.5%,Codex 得分为 58.0%。
Meta 研究博客发布《Solving Open Research Problems Together》,介绍数学家与 Muse Spark 合作完成六篇研究论文。该内容为 AI at Meta 转推并附上研究博客链接。
Meta 团队借助 Muse Spark 在非结合代数中找到了一个反例,推翻了受生物学启发提出的数学结构规则。他们进一步给出替代刻画,并由研究人员核验与完善。相关论文已发布在 Meta 研究页面。
Meta 分享六篇论文,来自数学家与 Muse Spark 1.1、Muse Spark 1.2 在 Thinking Mode 下通过常规 meta.ai 聊天界面协作求解开放数学问题,未使用定制研究框架。合作遵循数学家主导研究、第二组数学家评审、论文标注人机撰写段落并致谢所依据的先前研究等原则,对同一问题其他团队的独立解法也予以承认。
Gacha Decoding 通过给 LM 配备 RNG 工具并让其"掷骰规划",把多样性来源从 token 熵转向指令遵循,样本效率比此前方法提升逾 11 倍。
Meta AI 与芝加哥大学 Andrew Ferguson 团队合作,实现了对含显式溶剂、约 10 万原子的完整酶系统的近量子精度模拟,结果与真实酶活性实验测量相符。该方法比当前 SOTA 的 QM/MM 快约 1000 倍。
Hugging Face 的 Open ASR Leaderboard 新增多语言与长音频转录赛道,并发布基于 60+ 模型的 ASR 趋势预印本。
Hugging Face 发布 GAIA 的后续智能体基准 Gaia2,并配套开源 Meta Agents Research Environments(ARE)框架,用于运行、调试和评估智能体。
推荐理由:Gaia2 把智能体评测从只读检索扩展到读写交互,并给出各模型在歧义、适应性和时间推理上的差距。
Meta 推出 CyberSecEval 2,从代码解释器滥用、攻击性网络安全能力和提示注入攻击三方面评估 LLM 的网络安全风险。相比 2023 年 12 月的首版,LLM 协助网络攻击的平均合规率已从 52% 降至 28%。测试显示提示注入仍是未解难题,LLM 目前也难以可靠完成端到端漏洞利用挑战。