跳到正文
原文
Hugging Face Blog·· 2024-07-30AI 评分40

用 Quanto 和 Diffusers 实现内存高效的 Diffusion Transformer

AI 导读

Hugging Face 展示了如何借助 Diffusers 库中的 Quanto 量化工具降低 Transformer 扩散模型的内存占用。以 PixArt-Sigma、Stable Diffusion 3 和 Aura Flow 为例,将扩散主干与文本编码器量化为 FP8 后,SD3 推理显存从 16.403 GB 降至 8.204 GB,质量几乎无损但延迟略有上升。

当前提供 AI 导读,完整正文请阅读原文。

来源:Hugging Face Blog · huggingface.co