Pustaka Transformers dari Hugging Face kini mendukung pemuatan model terkuantisasi GGUF, memanfaatkan kernel ggml di bawahnya untuk membawa performa mendekati llama.cpp. Integrasi ini memungkinkan pengembang menjalankan checkpoint terkuantisasi langsung dalam API berbasis PyTorch standar pada perangkat keras yang didukung.

  • Kompatibilitas awalnya berfokus pada inferensi lokal untuk Apple Silicon, dimulai dengan arsitektur Qwen3.5.
  • Implementasi ini menggunakan kembali kernel Metal ggml melalui pustaka kernel baru dan mengurangi overhead dalam fungsi generate.
  • Pengguna dapat memuat model GGUF dengan meneruskan ID model Hub dan nama file ke from_pretrained tanpa konfigurasi tambahan.
  • Perintah transformers serve mengekspos API yang kompatibel dengan OpenAI untuk melayani model-model ini.
  • Benchmark pada MacBook Pro M2 Max menunjukkan Transformers berperforma mendekati llama.cpp di seluruh checkpoint dense dan mixture-of-experts.

Integrasi ini membawa fondasi definisi model Transformers lebih dekat ke fondasi inferensi lokal llama.cpp, memungkinkan pengembang bereksperimen dengan model GGUF menggunakan alat PyTorch yang akrab untuk inspeksi, evaluasi, dan fine-tuning.