Hugging Face Diffusers kini mendukung pemuatan checkpoint Nunchaku Lite secara native melalui `from_pretrained()`, menghilangkan kebutuhan akan mesin inferensi terpisah atau kompilasi CUDA lokal. Integrasi ini memanfaatkan metode SVDQuant untuk menjalankan lapisan transformer dengan bobot dan aktivasi 4-bit (W4A4), secara signifikan mengurangi penggunaan memori sambil meningkatkan kecepatan inferensi.
- Kernel NVFP4 memerlukan GPU NVIDIA Blackwell, sedangkan varian INT4 mendukung generasi sebelumnya.
- Sistem menggunakan `svdq_w4a4` untuk proyeksi perhatian/MLP dan `awq_w4a16` untuk lapisan normalisasi yang sensitif terhadap presisi.
- Benchmark pada RTX PRO 6000 menunjukkan pengurangan VRAM hingga 50% dan peningkatan latensi sekitar 30% dibandingkan baseline BF16.
- Menggabungkannya dengan `torch.compile` meningkatkan percepatan menjadi 1,8x, mengurangi latensi end-to-end menjadi 1,68 detik untuk generasi 1024x1024.
- Toolkit diffuse-compressor memungkinkan pengguna melakukan kuantisasi dan menerbitkan arsitektur baru sebagai repositori Diffusers standar.
Pembaruan ini memungkinkan pengguna memanfaatkan inferensi presisi rendah langsung dalam alur kerja Diffusers standar, membuat model difusi berkinerja tinggi lebih mudah diakses tanpa implementasi pipeline khusus.