Se evaluó un asignador de GPU consciente de restricciones frente a un programador FIFO en siete escenarios, logrando hasta 33 puntos porcentuales más de utilización de GPU y hasta un 105 % más de salida ponderada por prioridad en hardware idéntico. El sistema trata la demanda de inferencia en tiempo real como una curva fluctuante en lugar de una reserva estática, permitiendo que trabajos similares a lotes llenen la capacidad durante los valles mientras respeta restricciones estrictas como bloques contiguos de GPU y no preemption.

  • La utilización aumentó de un rango del 52–85 % al 72–88 %, con un valor ponderado por prioridad que aumentó en un promedio del 52 % en escenarios contendidos.
  • En una carga de trabajo intensiva en entrenamiento en 8 GPUs, la utilización saltó del 53,6 % al 87,0 %, más que duplicando el valor de salida.
  • El asignador opera en 1–2 milisegundos para escenarios estándar y en 15 milisegundos para pruebas a gran escala con 64 GPUs y 30 trabajos.
  • Incluso con prioridades uniformes, el sistema mejoró la utilización del 76,8 % al 87,5 %, demostrando que la planificación del horizonte contribuye a ganancias más allá de solo la ponderación por prioridad.

Al optimizar las decisiones de asignación en todo el horizonte de programación en lugar de depender del orden de llegada, el asignador previene la capacidad ociosa causada por reservas estáticas y asegura que las cargas de trabajo de alta prioridad se programen de manera eficiente.