Una propuesta en los foros de Hugging Face describe una capa común de ejecución y gestión de memoria para GPU, diseñada para desacoplar el código de la aplicación de proveedores específicos de hardware como NVIDIA, AMD e Intel. El objetivo es permitir a los usuarios especificar un presupuesto de memoria en lugar de configurar manualmente indicadores específicos del backend, mapas de dispositivos o estrategias de descarga.

  • El entorno de ejecución determinaría automáticamente la colocación de capas, la selección de precisión (INT4, INT8, FP8) y la gestión de la caché KV basándose en la VRAM disponible.
  • Introduce un modelo jerárquico de memoria con niveles para VRAM local de GPU, memoria de expansión, RAM del sistema y almacenamiento NVMe.
  • Se proponen tipos de datos de bajo bit como características de primera clase en el entorno de ejecución para evitar que los búferes de desquantización anulen los beneficios de la cuantización.
  • La arquitectura busca hacer práctica la inferencia INT4 de clase 13B en GPUs de consumo de 12 GB controlando toda la huella de memoria del entorno de ejecución.

Este enfoque busca abordar la compatibilidad fragmentada del software y las limitaciones de VRAM, permitiendo que las cargas de trabajo de IA se ejecuten eficientemente en mercados de GPU multi-proveedor sin requerir un acoplamiento estricto con CUDA u otros backends específicos del proveedor.