Hugging Face Diffusers prend désormais en charge le chargement natif des points de contrôle Nunchaku Lite via `from_pretrained()`, éliminant ainsi le besoin d'un moteur d'inférence séparé ou d'une compilation CUDA locale. Cette intégration utilise la méthode SVDQuant pour exécuter les couches transformateur avec des poids et activations en 4 bits (W4A4), réduisant considérablement l'utilisation de la mémoire tout en améliorant la vitesse d'inférence.
- Les noyaux NVFP4 nécessitent des GPU NVIDIA Blackwell, tandis que les variantes INT4 prennent en charge les générations antérieures.
- Le système utilise `svdq_w4a4` pour les projections attention/MLP et `awq_w4a16` pour les couches de normalisation sensibles à la précision.
- Les benchmarks sur un RTX PRO 6000 montrent une réduction de la VRAM jusqu'à 50 % et une amélioration de la latence d'environ 30 % par rapport aux références BF16.
- La combinaison avec `torch.compile` augmente le gain de vitesse à 1,8x, réduisant la latence de bout en bout à 1,68 seconde pour une génération de 1024x1024.
- L'outil diffuse-compressor permet aux utilisateurs de quantifier et de publier de nouvelles architectures en tant que dépôts Diffusers standard.
Cette mise à jour permet aux utilisateurs d'exploiter l'inférence basse précision directement dans le flux de travail standard de Diffusers, rendant les modèles de diffusion haute performance plus accessibles sans implémentations de pipeline personnalisées.