Hugging Face Diffusers는 이제 `from_pretrained()`를 통해 Nunchaku Lite 체크포인트를 네이티브로 로드할 수 있게 되어 별도의 추론 엔진이나 로컬 CUDA 컴파일이 필요하지 않게 되었습니다. 이 통합은 SVDQuant 방법을 사용하여 4비트 가중치와 활성화(W4A4)로 트랜스포머 레이어를 실행하며, 메모리 사용량을 크게 줄이는 동시에 추론 속도를 향상시킵니다.
- NVFP4 커널은 NVIDIA Blackwell GPU가 필요하며, INT4 변형은 이전 세대를 지원합니다.
- 시스템은 어텐션/MLP 투영에 `svdq_w4a4`를 사용하고 정밀도에 민감한 정규화 레이어에는 `awq_w4a16`을 사용합니다.
- RTX PRO 6000에서의 벤치마크 결과 BF16 기준선 대비 VRAM이 최대 50% 감소하고 지연 시간이 약 30% 개선되었습니다.
- `torch.compile`과 결합하면 속도 향상률이 1.8배로 증가하며, 1024x1024 생성에 대한 전체 지연 시간이 1.68초로 줄어듭니다.
- diffuse-compressor 툴킷을 통해 사용자는 새로운 아키텍처를 정량화하고 표준 Diffusers 저장소로 게시할 수 있습니다.
이 업데이트는 사용자가 표준 Diffusers 워크플로우 내에서 직접 저정밀도 추론을 활용할 수 있게 하여, 커스텀 파이프라인 구현 없이 고성능 확산 모델에 더 쉽게 접근할 수 있도록 합니다.