Hugging Face Diffusers теперь поддерживает загрузку контрольных точек Nunchaku Lite напрямую через `from_pretrained()`, что устраняет необходимость в отдельном движке вывода или локальной компиляции CUDA. Эта интеграция использует метод SVDQuant для выполнения слоёв трансформера с 4-битными весами и активациями (W4A4), что значительно снижает потребление памяти и одновременно повышает скорость вывода.

  • Ядра NVFP4 требуют графических процессоров NVIDIA Blackwell, тогда как варианты INT4 поддерживают более ранние поколения.
  • Система использует `svdq_w4a4` для проекций внимания/MLP и `awq_w4a16` для слоёв нормализации, чувствительных к точности.
  • Тесты на RTX PRO 6000 показывают снижение объёма VRAM до 50% и улучшение задержки примерно на 30% по сравнению с базовыми значениями BF16.
  • Комбинация с `torch.compile` увеличивает ускорение в 1,8 раза, снижая сквозную задержку до 1,68 секунды для генерации изображения размером 1024x1024.
  • Набор инструментов diffuse-compressor позволяет пользователям квантовать и публиковать новые архитектуры в виде стандартных репозиториев Diffusers.

Это обновление позволяет пользователям использовать вывод с низкой точностью непосредственно в стандартном рабочем процессе Diffusers, делая высокопроизводительные диффузионные модели более доступными без необходимости реализации пользовательских конвейеров.