Hugging Face Diffusers अब `from_pretrained()` के माध्यम से Nunchaku Lite चेकपॉइंट्स को नेटिव रूप से लोड करने का समर्थन करता है, जिससे अलग इनफरेंस इंजन या स्थानीय CUDA कंपाइलेशन की आवश्यकता समाप्त हो जाती है। यह एकीकरण SVDQuant विधि का उपयोग करके 4-बिट वेट्स और एक्टिवेशन (W4A4) के साथ ट्रांसफॉर्मर लेयर को चलाता है, जिससे मेमोरी उपयोग काफी कम होता है और इनफरेंस गति में सुधार होता है।
- NVFP4 kernels के लिए NVIDIA Blackwell GPUs की आवश्यकता होती है, जबकि INT4 वेरिएंट्स पहले पीढ़ी के GPU को सपोर्ट करते हैं।
- सिस्टम एटेंशन/MLP प्रोजेक्शंस के लिए `svdq_w4a4` और प्रिसिजन-संवेदनशील नॉर्मलाइजेशन लेयर के लिए `awq_w4a16` का उपयोग करता है।
- RTX PRO 6000 पर किए गए बेंचमार्क्स में BF16 बेलाइन की तुलना में VRAM में 50% तक की कमी और लगभग 30% लेटेंसी में सुधार दिखाया गया है।
- `torch.compile` के साथ संयोजन से स्पीडअप 1.8x तक बढ़ जाता है, जिससे 1024x1024 जनरेशन के लिए एंड-टू-एंड लेटेंसी 1.68 सेकंड हो जाती है।
- diffuse-compressor टूलकिट उपयोगकर्ताओं को नई आर्किटेक्चर्स को क्वांटाइज़ करने और उन्हें मानक Diffusers रिपॉजिटरी के रूप में प्रकाशित करने की अनुमति देता है।
यह अपडेट उपयोगकर्ताओं को मानक Diffusers वर्कफ़्लो के भीतर ही लो-प्रिसिजन इनफरेंस का लाभ उठाने सक्षम बनाता है, जिससे बिना कस्टम पाइपलाइन इम्प्लीमेंटेशन के हाई-परफॉर्मेंस डिफ्यूजन मॉडल्स को अधिक सुलभ बनाया गया है।