Hugging Face Diffusers 现在支持通过 `from_pretrained()` 原生加载 Nunchaku Lite 检查点,无需单独的推理引擎或本地 CUDA 编译。此集成利用 SVDQuant 方法运行具有 4-bit 权重和激活值(W4A4)的 Transformer 层,在显著降低内存使用的同时提高了推理速度。
- NVFP4 内核需要 NVIDIA Blackwell GPU,而 INT4 变体支持更早的代际。
- 系统使用 `svdq_w4a4` 进行注意力/MLP 投影,并使用 `awq_w4a16` 进行对精度敏感的归一化层。
- 在 RTX PRO 6000 上的基准测试显示,与 BF16 基线相比,VRAM 减少了多达 50%,延迟改善了约 30%。
- 结合 `torch.compile` 可将加速比提升至 1.8 倍,将 1024x1024 生成的端到端延迟降低至 1.68 秒。
- diffuse-compressor 工具包允许用户量化并发布新的架构作为标准 Diffusers 仓库。
此更新使用户能够直接在标准 Diffusers 工作流中利用低精度推理,使高性能扩散模型更易于获取,而无需自定义管道实现。