يدعم Hugging Face Diffusers الآن تحميل نقاط تفتيش Nunchaku Lite بشكل أصلي عبر `from_pretrained()`، مما يلغي الحاجة إلى محرك استدلال منفصل أو ترجمة CUDA محلية. تستفيد هذه التكاملات من طريقة SVDQuant لتشغيل طبقات المحوّل بأوزان وتنشيطات بدقة 4 بت (W4A4)، مما يقلل بشكل كبير من استخدام الذاكرة مع تحسين سرعة الاستدلال.
- تتطلب نوى NVFP4 وحدات معالجة رسومات NVIDIA Blackwell، بينما تدعم المتغيرات INT4 الأجيال السابقة.
- يستخدم النظام `svdq_w4a4` لتحويلات الانتباه/MLP و `awq_w4a16` لطبقات التطبيع الحساسة للدقة.
- أظهرت الاختبارات على RTX PRO 6000 انخفاضًا في VRAM يصل إلى 50% وتحسنًا في زمن الاستجابة بنسبة 30% تقريبًا مقارنة بأساسيات BF16.
- يؤدي الدمج مع `torch.compile` إلى زيادة سرعة التنفيذ بمقدار 1.8 مرة، مما يقلل زمن الاستجابة الإجمالي إلى 1.68 ثانية لتوليد بدقة 1024x1024.
- يسمح مجموعة الأدوات diffuse-compressor للمستخدمين بضغط ونشر معماريات جديدة كمستودعات Diffusers قياسية.
يتيح هذا التحديث للمستخدمين الاستفادة من الاستدلال منخفض الدقة مباشرةً داخل سير عمل Diffusers القياسي، مما يجعل نماذج الانتشار عالية الأداء أكثر سهولة دون الحاجة إلى تنفيذ خطوط أنابيب مخصصة.