Une proposition sur les forums de Hugging Face décrit une couche commune d'exécution GPU et de gestion de la mémoire conçue pour découpler le code applicatif des fournisseurs matériels spécifiques tels que NVIDIA, AMD et Intel. L'objectif est de permettre aux utilisateurs de spécifier un budget mémoire plutôt que de configurer manuellement des indicateurs spécifiques au backend, des cartes de périphérique ou des stratégies de déchargement.

  • Le runtime déterminerait automatiquement le placement des couches, la sélection de la précision (INT4, INT8, FP8) et la gestion du cache KV en fonction de la VRAM disponible.
  • Il introduit un modèle de mémoire hiérarchique avec des niveaux pour la VRAM locale du GPU, la mémoire d'expansion, la RAM système et le stockage NVMe.
  • Les types de données à faible bit sont proposés comme des fonctionnalités de premier ordre du runtime pour empêcher les tampons de déquantification de neutraliser les avantages de la quantification.
  • L'architecture vise à rendre l'inférence INT4 de classe 13B pratique sur les GPU grand public de 12 Go en contrôlant l'empreinte mémoire totale du runtime.

Cette approche cherche à résoudre la compatibilité logicielle fragmentée et les limitations de VRAM, permettant aux charges de travail IA de s'exécuter efficacement sur les marchés des GPU multi-fournisseurs sans nécessiter un couplage étroit avec CUDA ou d'autres backends spécifiques au fournisseur.