Hugging Face의 Transformers 라이브러리는 이제 기본 ggml 커널을 활용하여 llama.cpp에 가까운 성능을 제공하며 GGUF 양자화된 모델을 로드할 수 있게 되었습니다. 이 통합을 통해 개발자는 지원되는 하드웨어에서 표준 PyTorch 기반 API 내에서 양자화된 체크포인트를 직접 실행할 수 있습니다.

  • 호환성은 주로 Apple Silicon의 로컬 추론에 초점을 맞추며, Qwen3.5 아키텍처로 시작됩니다.
  • 구현은 새로운 커널 라이브러리를 통해 ggml Metal 커널을 재사용하고 generate 함수의 오버헤드를 줄입니다.
  • 사용자는 추가 구성 없이 from_pretrained에 Hub 모델 ID와 파일 이름을 전달하여 GGUF 모델을 로드할 수 있습니다.
  • transformers serve 명령어는 이러한 모델을 서빙하기 위해 OpenAI 호환 API를 노출합니다.
  • MacBook Pro M2 Max에서의 벤치마크 결과, Transformers가 밀집형 및 mixture-of-experts 체크포인트 모두에서 llama.cpp에 가까운 성능을 보였습니다.

이 통합은 Transformers의 모델 정의 기반을 llama.cpp의 로컬 추론 기반과 더 가깝게 만들어, 개발자가 inspection, evaluation, fine-tuning을 위해 익숙한 PyTorch 도구를 사용하여 GGUF 모델을 실험할 수 있게 합니다.