跳到正文
原文
Hugging Face Blog·· 2024-05-16AI 评分42

Hugging Face 推出 KV Cache 量化,支持 LLM 更长文本生成

AI 导读

Hugging Face 在 Transformers 中新增 KV Cache 量化功能,通过降低 KV 缓存精度减少长上下文生成的内存占用,对生成质量影响很小。

当前提供 AI 导读,完整正文请阅读原文。

来源:Hugging Face Blog · huggingface.co