rohanpaul_ai· @rohanpaul_ai · X·· 1 天前AI 评分
Hybrid Latent Attention 让循环 LLM 吞吐提升至 8.8 倍
Virginia Tech 论文提出 Hybrid Latent Attention,将旧 token 压缩为紧凑向量供 attention 直接读取,使循环 LLM 每 GPU 吞吐提升 4.0 至 8.8 倍且精度损失极小。
弗吉尼亚理工大学的新论文展示了如何将较早的 token 缓存为紧凑向量,供注意力机制直接读取,而循环 LLM 每 GPU 可处理 4.0 到 8.8 倍的请求,且精度损失很小。
循环模型会让每个 token 多次经过相同的层,而每次遍历都会增加 KV 缓存,因此 GPU 上能容纳的请求更少。
混合隐式注意力(Hybrid Latent Attention)保留最后 128 个 token 的精确表示,并将更早的 token 压缩成小向量,每个循环都能读取这些向量,无需重建任何内容。
在 Ouro 模型上,16K token 时吞吐量最高提升 7.4 倍,而数学、知识和推理任务的精度保持在原始模型的 97% 以上。
在长上下文场景中收益最大。你只需训练新增的部分,就能将现有循环检查点改造升级。
– arxiv. org/abs/2610.07940
标题:《面向循环语言模型的混合隐式注意力》(Hybrid Latent Attention for Looped Language Models)
来源:rohanpaul_ai · x.com