清华TokenRouter实现逐Token模型路由
先了解这件事
AI 综述
2026年10月10日,X用户Rohan Paul发布消息称,清华大学论文提出TokenRouter,一个支持逐Token大小模型路由的LLM服务系统。该系统针对vLLM、SGLang等框架一请求一模型导致的慢模型拖累问题,为每个模型分配独立服务器,通过传递半成品回答并同步KV cache,同时短暂缓存请求以增大各模型的批处理规模。在5种路由方法下,TokenRouter吞吐量较现有最强方案提升2.01至64.15倍。
报道时间线
10月10日
- 清华 TokenRouter 实现逐 Token 模型路由,吞吐最高提升 64.15 倍
清华大学论文提出 TokenRouter,一个支持逐 Token 大小模型路由的 LLM 服务系统,在 5 种路由方法下吞吐量较现有最强方案提升 2.01 至 64.15 倍。针对 vLLM、SGLang 等框架一请求一模型导致的慢模型拖累问题,TokenRouter 为每个模型分配独立服务器,通过传递半成品回答并同步 KV cache,同时短暂缓存请求以增大各模型的批处理规模。