跳到正文
原文
Hugging Face Blog·· 13 天前精选AI 评分62

Transformers 支持直接运行 llama.cpp 的 GGUF 量化模型

Transformers now runs llama.cpp quants

AI 导读

Hugging Face 为 transformers 加入 GGUF 支持,可直接用 from_pretrained 加载 Hub 上的量化 checkpoint 并在本地生成,目前聚焦 Apple Silicon 与 Qwen3.5 架构。

推荐理由

原文给出在 transformers 中直接加载 GGUF 的用法与 Apple Silicon 上的实测对比,可据此判断本地推理工作流是否值得迁移。

来源:Hugging Face Blog · huggingface.co