Hugging Face 的 Transformers 库现在支持加载 GGUF 量化模型,利用底层 ggml 内核使性能接近 llama.cpp。此集成允许开发者在支持的硬件上直接在标准的 PyTorch API 中运行量化检查点。

  • 兼容性最初专注于 Apple Silicon 上的本地推理,从 Qwen3.6-27B 架构开始。
  • 该实现通过新的 kernels 库重用 ggml Metal 内核,并减少 generate 函数中的开销。
  • 用户可以通过向 from_pretrained 传递 Hub 模型 ID 和文件名来加载 GGUF 模型,无需额外配置。
  • transformers serve 命令暴露了一个与 OpenAI 兼容的 API 用于服务这些模型。
  • 在 MacBook Pro M2 Max 上的基准测试显示,Transformers 在密集型和混合专家(mixture-of-experts)检查点上的性能接近 llama.cpp。

此集成使 Transformers 的模型定义基础更接近 llama.cpp 的本地推理基础,使开发者能够使用熟悉的 PyTorch 工具来检查、评估和微调 GGUF 模型。