La bibliothèque Transformers de Hugging Face prend désormais en charge le chargement de modèles quantifiés GGUF, en s'appuyant sur les noyaux ggml sous-jacents pour offrir des performances proches de celles de llama.cpp. Cette intégration permet aux développeurs d'exécuter des points de contrôle quantifiés directement au sein de l'API standard basée sur PyTorch sur le matériel pris en charge.
- La compatibilité se concentre initialement sur l'inférence locale pour Apple Silicon, en commençant par l'architecture Qwen3.5.
- L'implémentation réutilise les noyaux Metal de ggml via la nouvelle bibliothèque de noyaux et réduit la surcharge dans la fonction generate.
- Les utilisateurs peuvent charger des modèles GGUF en passant l'ID du modèle Hub et le nom du fichier à from_pretrained sans configuration supplémentaire.
- La commande serve de transformers expose une API compatible OpenAI pour servir ces modèles.
- Les benchmarks sur un MacBook Pro M2 Max montrent que Transformers atteint des performances proches de celles de llama.cpp sur les points de contrôle denses et mixture-of-experts.
Cette intégration rapproche le fondement de la définition des modèles de Transformers du fondement de l'inférence locale de llama.cpp, permettant aux développeurs d'expérimenter avec des modèles GGUF en utilisant des outils PyTorch familiers pour l'inspection, l'évaluation et le fine-tuning.