O Hugging Face Diffusers agora suporta o carregamento nativo de checkpoints do Nunchaku Lite por meio de `from_pretrained()`, eliminando a necessidade de um mecanismo de inferência separado ou compilação CUDA local. Essa integração utiliza o método SVDQuant para executar camadas de transformador com pesos e ativações de 4 bits (W4A4), reduzindo significativamente o uso de memória enquanto melhora a velocidade de inferência.
- Os kernels NVFP4 exigem GPUs NVIDIA Blackwell, enquanto as variantes INT4 suportam gerações anteriores.
- O sistema utiliza `svdq_w4a4` para projeções de atenção/MLP e `awq_w4a16` para camadas de normalização sensíveis à precisão.
- Benchmarks em uma RTX PRO 6000 mostram redução de até 50% na VRAM e melhoria de aproximadamente 30% na latência em relação às linhas de base BF16.
- Combinar com `torch.compile` aumenta o ganho de velocidade para 1,8x, reduzindo a latência de ponta a ponta para 1,68 segundos para geração de 1024x1024.
- O toolkit diffuse-compressor permite que os usuários quantizem e publiquem novas arquiteturas como repositórios padrão do Diffusers.
Esta atualização permite que os usuários aproveitem a inferência de baixa precisão diretamente dentro do fluxo de trabalho padrão do Diffusers, tornando os modelos de difusão de alto desempenho mais acessíveis sem implementações personalizadas de pipeline.