A biblioteca Transformers do Hugging Face agora suporta o carregamento de modelos quantizados em GGUF, aproveitando os kernels ggml subjacentes para trazer o desempenho próximo ao do llama.cpp. Essa integração permite que desenvolvedores executem checkpoints quantizados diretamente na API padrão baseada em PyTorch em hardware compatível.
- A compatibilidade foca inicialmente na inferência local para Apple Silicon, começando com a arquitetura Qwen3.5.
- A implementação reutiliza os kernels Metal do ggml por meio da nova biblioteca de kernels e reduz a sobrecarga na função generate.
- Os usuários podem carregar modelos GGUF passando o ID do modelo do Hub e o nome do arquivo para from_pretrained sem configuração adicional.
- O comando serve do transformers expõe uma API compatível com OpenAI para servir esses modelos.
- Benchmarks em um MacBook Pro M2 Max mostram o Transformers performando próximo ao llama.cpp em checkpoints densos e mixture-of-experts.
Essa integração aproxima a base de definição de modelos do Transformers da base de inferência local do llama.cpp, permitindo que desenvolvedores experimentem modelos GGUF usando ferramentas PyTorch familiares para inspeção, avaliação e ajuste fino.