跳到正文

#论文/研究

今日 0 条
10月5日周一
10月4日周日
  1. Hugging Face Blog71

    微软与 Hugging Face 发布 ThinkingBox:按数据库终态而非生成文本给 AI 智能体打分

    微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,按终端后端状态和副作用而非生成文本打分,覆盖 507 个有状态业务流程、每个任务重复运行 20 次。

    推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用 507 个有状态工作流和 20 次重复运行,把工具调用成功率与数据库终态正确率区分开来。

10月3日周六
  1. dair_ai57

    微软一篇新论文提出 FOCUS 方法,在测试时压缩智能体上下文:它判断智能体的下一次决策实际依赖哪些历史交互,保留这些单元并丢弃其余部分。该方法无需训练数据或微调,可作为独立层置于闭源 API 模型之前;在工具调用、QA、网页和多轮对话基准上,相比使用完整历史,峰值上下文最多减少 48%,任务成功率最多提升 8.9 分。论文地址:academy.dair.ai/papers/focus…

  2. The Decoder52

    AI 智能体从单张照片生成 Blender 3D 场景,但无法判断自己是否做对

    研究提出 Image-to-Code 方法,让编码智能体接收单张图片后编写可执行的 Blender 程序,通过写代码、运行、查看结果并迭代修改来还原场景。团队同时发布 LEGO-Bench 基准,包含 104 个室内外场景的 208 张图像和 443 个注册资产,从有效性、几何精度和外观相似度三个维度评分。

  3. X:Ethan Mollick (@emollick)62

    研究称前沿 AI 模型在会计任务上已快于并准于初级会计师

    一项研究指出,在中等长度、定义明确的会计任务上,前沿 AI 模型现在比初级会计师更快、更准确,甚至优于研究中表现最好的那位会计师。作者提到,18 个月前这些模型的得分还远低于人类会计师。相关讨论见 Mercor 博客文章《Human Baselines for Benchmarks: AI Now Outperforms Junior Accountants》。

  4. X:Elvis Saravia (@omarsar0, DAIR.AI)44

    AgentWorld 论文:多智能体团队不到三分之一的行动真正有助于完成任务

    AgentWorld 将 3 到 20 个不同角色的 LLM 智能体放入游戏沙盒,执行 50+ 轮的长程任务,结果显示多智能体团队中不到三分之一的行动真正有助于完成任务。Gemini 3 Flash 任务成功率最高,为 52.0%;协调类任务最难,成功率仅 12%,常见失败包括沟通中断、角色混淆和共享计划丢失。

  5. X:Elvis Saravia (@omarsar0, DAIR.AI)29

    ProVer:用 LLM 裁判定位关键步骤,改进智能体 RL 的信用分配

    ProVer 提出一种智能体强化学习信用分配方法:由 LLM 裁判对比成功与失败的 rollout,指出造成差异的关键片段,再通过该片段前后采样续写、以成功率变化作为该片段的优势值。在 ALFWorld、WebShop 和 SearchQA 上,相对 GRPO 分别带来 Qwen3.5-2B 9.91%、Qwen3.5-4B 7.12% 的相对提升,裁判换成更小模型时仍有效。

  6. X:Rohan Paul (@rohanpaul_ai)78

    研究显示 Claude Opus 5 在会计任务上 20 题全对,12 名注册会计师正确率 0% 至约 90%

    一项针对中等长度、定义明确的会计任务的研究发现,前沿 AI 模型比初级会计师更快更准确,甚至优于研究中表现最好的会计师。Claude Opus 5 在 20 道题中取得 20 题全对、正确率 100%,每题几分钟内完成;12 名持证注册会计师的正确率从 0% 到约 90% 不等,其中数人用完了 3 小时时限。研究还提到,18 个月前这些模型在同类任务上的得分远低于人类会计师。