Um alocador de GPU com consciência de restrições foi benchmarkado contra um agendador FIFO em sete cenários, alcançando até 33 pontos percentuais mais de utilização da GPU e até 105% mais saída ponderada por prioridade em hardware idêntico. O sistema trata a demanda de inferência em tempo real como uma curva flutuante em vez de uma reserva estática, permitindo que trabalhos do tipo batch preencham a capacidade durante os vales enquanto respeita restrições rigorosas como blocos contíguos de GPU e não-preempção.

  • A utilização subiu de uma faixa de 52–85% para 72–88%, com o valor ponderado por prioridade aumentando em média 52% nos cenários contestados.
  • Em uma carga de trabalho focada em treinamento em 8 GPUs, a utilização saltou de 53,6% para 87,0%, mais que dobrando o valor da saída.
  • O alocador opera em 1–2 milissegundos para cenários padrão e 15 milissegundos para testes em larga escala com 64 GPUs e 30 trabalhos.
  • Mesmo com prioridades uniformes, o sistema melhorou a utilização de 76,8% para 87,5%, demonstrando que o planejamento do horizonte contribui para ganhos além da ponderação por prioridade apenas.

Ao otimizar as decisões de alocação ao longo de todo o horizonte de agendamento em vez de depender da ordem de chegada, o alocador impede a capacidade ociosa causada por reservas estáticas e garante que cargas de trabalho de alta prioridade sejam agendadas de forma eficiente.