Um diagnóstico usando o pipeline de inferência agnóstico a hardware da Celestium demonstra que o Stable Diffusion XL pode rodar de forma estável em GPUs com pouca VRAM (4GB, 6GB e 8GB) ao aproveitar precisão FP16 adaptativa e limpeza autônoma de memória. A abordagem evita picos de fragmentação durante pipelines multiestágio e utiliza um modo de emergência na CPU para manter a geração quando a VRAM da GPU se esgota.

  • SDXL Base + Refiner roda em GPUs de 8GB, enquanto apenas o SDXL Base é recomendado para placas de 4GB.
  • A precisão FP16 adaptativa reduz a carga de VRAM, e o BuffaloCore redimensiona dinamicamente os tensores para evitar transbordamento.
  • O RealESRGANx2 adiciona sobrecarga mínima mesmo em GPUs de 4GB, e o sistema não requer dependências de nuvem ou CUDA.

Este método permite que o SDXL rode offline e localmente sem travamentos em hardware de consumo que normalmente tem dificuldades com os requisitos de memória do modelo.