O Hugging Face Diffusers agora suporta o carregamento nativo de checkpoints do Nunchaku Lite por meio de `from_pretrained()`, eliminando a necessidade de um mecanismo de inferência separado ou compilação CUDA local. Essa integração utiliza o método SVDQuant para executar camadas de transformador com pesos e ativações de 4 bits (W4A4), reduzindo significativamente o uso de memória enquanto melhora a velocidade de inferência.

  • Os kernels NVFP4 exigem GPUs NVIDIA Blackwell, enquanto as variantes INT4 suportam gerações anteriores.
  • O sistema utiliza `svdq_w4a4` para projeções de atenção/MLP e `awq_w4a16` para camadas de normalização sensíveis à precisão.
  • Benchmarks em uma RTX PRO 6000 mostram redução de até 50% na VRAM e melhoria de aproximadamente 30% na latência em relação às linhas de base BF16.
  • Combinar com `torch.compile` aumenta o ganho de velocidade para 1,8x, reduzindo a latência de ponta a ponta para 1,68 segundos para geração de 1024x1024.
  • O toolkit diffuse-compressor permite que os usuários quantizem e publiquem novas arquiteturas como repositórios padrão do Diffusers.

Esta atualização permite que os usuários aproveitem a inferência de baixa precisão diretamente dentro do fluxo de trabalho padrão do Diffusers, tornando os modelos de difusão de alto desempenho mais acessíveis sem implementações personalizadas de pipeline.