Библиотека Transformers от Hugging Face теперь поддерживает загрузку квантованных моделей в формате GGUF, используя базовые ядра ggml для достижения производительности, близкой к llama.cpp. Эта интеграция позволяет разработчикам запускать квантованные контрольные точки непосредственно через стандартный API на основе PyTorch на поддерживаемом оборудовании.
- Совместимость изначально сосредоточена на локальном выводе для Apple Silicon, начиная с архитектуры Qwen3.6-27B.
- Реализация повторно использует ядра Metal из ggml через новую библиотеку kernels и снижает накладные расходы в функции generate.
- Пользователи могут загружать модели GGUF, передавая идентификатор модели и имя файла из Hub в from_pretrained без дополнительной конфигурации.
- Команда transformers serve предоставляет API, совместимый с OpenAI, для обслуживания этих моделей.
- Тесты на MacBook Pro M2 Max показывают, что Transformers демонстрирует производительность, близкую к llama.cpp, как для плотных, так и для смесей экспертов (mixture-of-experts) контрольных точек.
Эта интеграция приближает фундамент определения моделей в Transformers к фундаменту локального вывода llama.cpp, позволяя разработчикам экспериментировать с моделями GGUF, используя знакомые инструменты PyTorch для инспекции, оценки и тонкой настройки.