Meta论文提出Sharpening Tax:RL后训练削弱测试时可扩展性
先了解这件事
AI 综述
2026年10月4日,DAIR.AI(Elvis Saravia)在X上连续发布并推荐Meta Superintelligence Labs的一篇论文。论文提出“Sharpening Tax”概念,指出RL后训练会削弱基座模型的测试时可扩展性。核心发现是:在配备轻量推理框架且采样量(测试时预算)充足时,预训练基座模型即可充当能力足够的智能体,甚至能超越经过RL后训练的对应模型。具体表现为,后训练模型在pass@1指标上占优,但在BFCL v4 multi-turn、ACEBench和WebShop等智能体任务上,当采样次数K较大时,基座模型常能解决后训练模型始终无法解决的任务。
报道时间线
10月4日
- 论文:轻量推理框架下预训练 LLM 可超越后训练模型
Elvis Saravia 推荐一篇论文,其核心发现是配备轻量推理框架的预训练大语言模型即可充当能力足够的智能体,在测试时预算充足的情况下甚至能超越经过后训练的对应模型。
- Meta Superintelligence Labs 论文提出 Sharpening Tax,指出 RL 后训练削弱基座模型的测试时可扩展性
Meta Superintelligence Labs 的论文发现,在采样量充足时,配轻量框架的基座模型往往比 RL 后训练版本解决更多智能体任务:后训练模型在 pass@1 上占优,但在 BFCL v4 multi-turn、ACEBench 和 WebShop 上,大 K 时基座模型常能解决后训练模型始终解决不了的任务。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。