omarsar0· @omarsar0 · X·· 5 小时前AI 评分
Elvis Saravia 看好后训练降本趋势:Tinker 长上下文 token 降价利好 agentic RL
Elvis Saravia 表示看好让后训练更易获取的趋势,指出在 agentic RL 中长上下文任务昂贵且难以扩展,而 rollout 占用大部分 token,每一轮都要重读不断增长的上下文。
我看好让后训练变得更易获取的这一趋势。
后训练的新时代即将到来。
如果你从事智能体强化学习(agentic RL)工作,就会知道长上下文任务(当今的一大重点)成本高、效率低,且难以扩展。
我一直在深入研究长上下文任务的强化学习环境和评估,能看出这会很有用。
在智能体强化学习中,rollout(轨迹生成)消耗了大部分 token。每一轮都会重新读取不断增长的完整上下文,包括工具输出、文件和之前的对话轮次。
Tinker 刚刚降低了这些 token 的价格。现在长上下文的预填充(prefill)和采样(sampling)成本与短上下文相同。
这意味着用长输入评估你训练好的模型也变得更便宜了。这是一大利好。
我相信,强化学习将持续催生专用模型,大幅降低关键智能体操作的成本。更便宜的长 rollout 让这些模型的构建更具可行性。
掌控你自己的智能栈!
来源:omarsar0 · x.com