跳到正文
原文
rohanpaul_ai· @rohanpaul_ai · X·· 1 天前AI 评分45

清华 TokenRouter 实现逐 Token 模型路由,吞吐最高提升 64.15 倍

AI 导读

清华大学论文提出 TokenRouter,一个支持逐 Token 大小模型路由的 LLM 服务系统,在 5 种路由方法下吞吐量较现有最强方案提升 2.01 至 64.15 倍。针对 vLLM、SGLang 等框架一请求一模型导致的慢模型拖累问题,TokenRouter 为每个模型分配独立服务器,通过传递半成品回答并同步 KV cache,同时短暂缓存请求以增大各模型的批处理规模。

正文 · AI 翻译

清华大学最新论文提出了 TokenRouter,一个服务系统,其逐 token 的大小模型路由吞吐量最高可达现有方案的 64.15 倍。

当前主流的服务框架(如 vLLM 和 SGLang)每个请求只运行一个模型,因此当两个模型共同生成一个回答时,每一步都得等待较慢的那个。

TokenRouter 为每个模型分配独立的服务器,让它们来回传递工作。也就是说,它在两个模型之间传递写到一半的回答,同时保留模型对已有文本的记忆(KV 缓存),并短暂挂起请求,以便每个模型处理更大的批次。

在 5 种路由方法中,吞吐量相比更强的现有方案提升了 2.01 至 64.15 倍。

– arxiv. org/abs/2610.12242

标题:"TokenRouter: Efficient Serving System for Token-Level LLM Routing"

来源:rohanpaul_ai · x.com