Uma proposta nos fóruns da Hugging Face descreve uma camada comum de execução de GPU e gerenciamento de memória projetada para desacoplar o código de aplicação de fornecedores específicos de hardware, como NVIDIA, AMD e Intel. O objetivo é permitir que os usuários especifiquem um orçamento de memória em vez de configurar manualmente sinalizações específicas do backend, mapeamentos de dispositivo ou estratégias de offloading.

  • O tempo de execução determinaria automaticamente o posicionamento das camadas, a seleção de precisão (INT4, INT8, FP8) e o gerenciamento do cache KV com base na VRAM disponível.
  • Introduz um modelo de memória hierárquico com níveis para VRAM local da GPU, memória de expansão, RAM do sistema e armazenamento NVMe.
  • Tipos de dados de baixo bit são propostos como recursos de primeira classe no tempo de execução para evitar que buffers de desquantização anulem os benefícios da quantização.
  • A arquitetura visa tornar a inferência INT4 de classe 13B prática em GPUs consumer de 12 GB, controlando toda a pegada de memória do tempo de execução.

Essa abordagem busca abordar a compatibilidade fragmentada do software e as limitações de VRAM, permitindo que cargas de trabalho de IA sejam executadas com eficiência nos mercados de GPU multi-fornecedor sem exigir acoplamento rígido ao CUDA ou outros backends específicos do fornecedor.