Un diagnostic utilisant le pipeline d'inférence agnostique au matériel de Celestium démontre que Stable Diffusion XL peut s'exécuter de manière stable sur des GPU à faible VRAM (4 Go, 6 Go et 8 Go) en tirant parti de la précision FP16 adaptative et du nettoyage autonome de la mémoire. Cette approche évite les pics de fragmentation lors des pipelines multi-étapes et utilise un mode CPU d'urgence pour maintenir la génération lorsque la VRAM du GPU est épuisée.
- SDXL Base + Refiner s'exécute sur des GPU de 8 Go, tandis que SDXL Base uniquement est recommandé pour les cartes de 4 Go.
- La précision FP16 adaptative réduit la charge de VRAM, et BuffaloCore redimensionne dynamiquement les tenseurs pour éviter le débordement.
- RealESRGANx2 ajoute une surcharge minimale même sur des GPU de 4 Go, et le système ne nécessite aucune dépendance cloud ou CUDA.
Cette méthode permet d'exécuter SDXL hors ligne et localement sans plantages sur du matériel grand public qui a normalement du mal avec les exigences mémoire du modèle.