跳到正文
原文
omarsar0· @omarsar0 · X·· 5 小时前AI 评分58

Elvis Saravia 看好后训练降本趋势:Tinker 长上下文 token 降价利好 agentic RL

AI 导读

Elvis Saravia 表示看好让后训练更易获取的趋势,指出在 agentic RL 中长上下文任务昂贵且难以扩展,而 rollout 占用大部分 token,每一轮都要重读不断增长的上下文。

正文 · AI 翻译

我看好让后训练变得更易获取的这一趋势。

后训练的新时代即将到来。

如果你从事智能体强化学习(agentic RL)工作,就会知道长上下文任务(当今的一大重点)成本高、效率低,且难以扩展。

我一直在深入研究长上下文任务的强化学习环境和评估,能看出这会很有用。

在智能体强化学习中,rollout(轨迹生成)消耗了大部分 token。每一轮都会重新读取不断增长的完整上下文,包括工具输出、文件和之前的对话轮次。

Tinker 刚刚降低了这些 token 的价格。现在长上下文的预填充(prefill)和采样(sampling)成本与短上下文相同。

这意味着用长输入评估你训练好的模型也变得更便宜了。这是一大利好。

我相信,强化学习将持续催生专用模型,大幅降低关键智能体操作的成本。更便宜的长 rollout 让这些模型的构建更具可行性。

掌控你自己的智能栈!

来源:omarsar0 · x.com