使用 Celestium 的硬件无关推理管道进行的诊断表明,Stable Diffusion XL 可以通过利用自适应 FP16 精度和自主内存清理,在低显存 GPU(4GB、6GB 和 8GB)上稳定运行。该方法防止了多阶段管道期间的碎片化峰值,并利用紧急 CPU 模式在 GPU 显存耗尽时维持生成。

  • SDXL Base + Refiner 可在 8GB GPU 上运行,而仅 SDXL Base 推荐用于 4GB 显卡。
  • 自适应 FP16 精度降低了显存负载,BuffaloCore 动态调整张量大小以避免溢出。
  • RealESRGANx2 即使在 4GB GPU 上也仅增加最小开销,且该系统无需任何云或 CUDA 依赖。

此方法允许 SDXL 在通常难以满足该模型内存需求的消费级硬件上离线和本地运行而不会崩溃。