La biblioteca Transformers de Hugging Face ahora admite la carga de modelos cuantizados en formato GGUF, aprovechando los núcleos subyacentes de ggml para acercar el rendimiento al de llama.cpp. Esta integración permite a los desarrolladores ejecutar puntos de control cuantizados directamente dentro de la API estándar basada en PyTorch en hardware compatible.

  • La compatibilidad se centra inicialmente en la inferencia local para Apple Silicon, comenzando con la arquitectura Qwen3.5.
  • La implementación reutiliza los núcleos Metal de ggml a través de la nueva biblioteca de núcleos y reduce la sobrecarga en la función generate.
  • Los usuarios pueden cargar modelos GGUF pasando el ID del modelo de Hub y el nombre del archivo a from_pretrained sin configuración adicional.
  • El comando serve de transformers expone una API compatible con OpenAI para servir estos modelos.
  • Las pruebas en un MacBook Pro M2 Max muestran que Transformers tiene un rendimiento cercano al de llama.cpp en puntos de control densos y de mezcla de expertos.

Esta integración acerca la base de definición de modelos de Transformers a la base de inferencia local de llama.cpp, permitiendo a los desarrolladores experimentar con modelos GGUF utilizando herramientas PyTorch familiares para inspección, evaluación y ajuste fino.