循环LLM新注意力机制吞吐提升至8.8倍
先了解这件事
AI 综述
2026年10月7日,X用户Rohan Paul发布消息称,Virginia Tech一篇论文提出Hybrid Latent Attention(混合潜在注意力)机制。该机制将旧token压缩为紧凑向量,供attention直接读取,使循环LLM每GPU吞吐提升4.0至8.8倍,且精度损失极小。目前仅见此一条报道,尚无后续进展或相关争议。
报道时间线
10月7日
- Hybrid Latent Attention 让循环 LLM 吞吐提升至 8.8 倍
Virginia Tech 论文提出 Hybrid Latent Attention,将旧 token 压缩为紧凑向量供 attention 直接读取,使循环 LLM 每 GPU 吞吐提升 4.0 至 8.8 倍且精度损失极小。