Hugging Face Diffusers ahora admite la carga de checkpoints de Nunchaku Lite de forma nativa mediante `from_pretrained()`, eliminando la necesidad de un motor de inferencia separado o compilación local de CUDA. Esta integración utiliza el método SVDQuant para ejecutar capas transformadoras con pesos y activaciones de 4 bits (W4A4), reduciendo significativamente el uso de memoria mientras mejora la velocidad de inferencia.

  • Los kernels NVFP4 requieren GPUs NVIDIA Blackwell, mientras que las variantes INT4 admiten generaciones anteriores.
  • El sistema utiliza `svdq_w4a4` para proyecciones de atención/MLP y `awq_w4a16` para capas de normalización sensibles a la precisión.
  • Las pruebas en una RTX PRO 6000 muestran hasta un 50% de reducción de VRAM y aproximadamente un 30% de mejora en latencia frente a las líneas base BF16.
  • Combinarlo con `torch.compile` aumenta la aceleración a 1.8x, reduciendo la latencia de extremo a extremo a 1.68 segundos para una generación de 1024x1024.
  • La herramienta diffuse-compressor permite a los usuarios cuantificar y publicar nuevas arquitecturas como repositorios estándar de Diffusers.

Esta actualización permite a los usuarios aprovechar la inferencia de baja precisión directamente dentro del flujo de trabajo estándar de Diffusers, haciendo que los modelos de difusión de alto rendimiento sean más accesibles sin implementaciones personalizadas de pipelines.