Hugging Face Diffusersは、`from_pretrained()`経由でNunchaku Liteチェックポイントをネイティブに読み込む機能を追加し、個別の推論エンジンやローカルCUDAコンパイルの必要性を排除しました。この統合ではSVDQuant方式を用いて4ビット重みと活性化(W4A4)によるTransformerレイヤーを実行し、メモリ使用量を大幅に削減しつつ推論速度を向上させます。
- NVFP4カーネルにはNVIDIA Blackwell GPUが必要ですが、INT4バリアントは以前の世代でもサポートされます。
- システムは注意機構/MLP射影に`svdq_w4a4`を、精度が敏感な正規化レイヤーに`awq_w4a16`を使用します。
- RTX PRO 6000でのベンチマークでは、BF16ベースラインと比較してVRAMが最大50%削減され、レイテンシが約30%改善されました。
- `torch.compile`と組み合わせることで速度向上が1.8倍になり、1024x1024の生成におけるエンドツーエンドのレイテンシは1.68秒に短縮されます。
- diffuse-compressorツールキットにより、ユーザーは新しいアーキテクチャを標準的なDiffusersリポジトリとして量子化・公開できます。
このアップデートにより、ユーザーは標準的なDiffusersワークフロー内で直接低精度推論を活用でき、カスタムパイプライン実装なしで高性能な拡散モデルへのアクセスが容易になります。