跳到正文

#推理

今日 5 条
10月6日周二
  1. dair_ai61

    一篇 Harvard-MIT 论文发现,在拍卖与匹配市场场景中,给智能体加“提前规划”或“考虑其他玩家”这类提示词会使其整体表现变差。作者采用已知最优策略的设定,可对每次选择打分;真正有效的是改变界面,例如一次只呈现一个安全选项的升序拍卖在四个模型家族上都减少了出价错误,直接说明收益结构和为何如实出价是安全的也有帮助。

10月5日周一
10月4日周日
10月3日周六
  1. X:Elvis Saravia (@omarsar0, DAIR.AI)29

    ProVer:用 LLM 裁判定位关键步骤,改进智能体 RL 的信用分配

    ProVer 提出一种智能体强化学习信用分配方法:由 LLM 裁判对比成功与失败的 rollout,指出造成差异的关键片段,再通过该片段前后采样续写、以成功率变化作为该片段的优势值。在 ALFWorld、WebShop 和 SearchQA 上,相对 GRPO 分别带来 Qwen3.5-2B 9.91%、Qwen3.5-4B 7.12% 的相对提升,裁判换成更小模型时仍有效。

  2. SemiAnalysis_40

    GPU 是印钞机吗? IngramX 团队解析了 Engram 内存卸载、AgentX 的利润计算器、TPU v7、Vera Rubin 与 Blackwell 的对比,以及更快的 token 是否值得溢价。 此外:TileRT 正在进一步挖掘 NVIDIA GPU 的潜力。这对专用芯片意味着什么? Jordan Nanos (@JordanNanos) 与 Cam Quilici (@noslawextratost)、Bryan Shan 和 Alec Ibarra 一起带来新一期 SemiAnalysis Weekly。