Un allocateur GPU conscient des contraintes a été comparé à un planificateur FIFO dans sept scénarios, atteignant jusqu'à 33 points de pourcentage d'utilisation GPU en plus et jusqu'à 105 % de sortie pondérée par priorité en plus sur du matériel identique. Le système traite la demande d'inférence en temps réel comme une courbe fluctuante plutôt que comme une réservation statique, permettant aux jobs de type batch de remplir la capacité pendant les creux tout en respectant des contraintes strictes telles que des blocs GPU contigus et l'absence de préemption.

  • L'utilisation est passée d'une bande de 52–85 % à 72–88 %, avec une augmentation moyenne de 52 % de la valeur pondérée par priorité dans les scénarios contestés.
  • Dans une charge de travail axée sur l'entraînement sur 8 GPU, l'utilisation a bondi de 53,6 % à 87,0 %, plus que doublant la valeur de sortie.
  • L'allocateur fonctionne en 1–2 millisecondes pour les scénarios standards et en 15 millisecondes pour les tests à grande échelle avec 64 GPU et 30 jobs.
  • Même avec des priorités uniformes, le système a amélioré l'utilisation de 76,8 % à 87,5 %, démontrant que la planification d'horizon contribue aux gains au-delà du simple pondération par priorité.

En optimisant les décisions d'allocation sur tout l'horizon de planification plutôt que de s'appuyer sur l'ordre d'arrivée, l'allocateur empêche la capacité idle causée par les réservations statiques et garantit que les charges de travail à haute priorité sont planifiées efficacement.