制約対応GPUアロケータは、7つのシナリオにおいてFIFOスケジューラと比較ベンチマークされ、同一ハードウェア上でGPU利用率が最大33パーセントポイント上昇し、優先度加重出力が最大105%増加した。このシステムは、リアルタイム推論需要を静的な予約ではなく変動する曲線として扱い、連続するGPUブロックや非プリエンプションといった厳格な制約を尊重しつつ、谷間の時間帯にバッチ処理のようなジョブで容量を埋めることを可能にする。
- 利用率は52–85%の範囲から72–88%に上昇し、争奪シナリオ全体で優先度加重値が平均52%増加した。
- 8 GPUでのトレーニング中心ワークロードでは、利用率が53.6%から87.0%に跳ね上がり、出力価値は2倍以上となった。
- アロケータは標準シナリオで1–2ミリ秒、64 GPUと30ジョブの大規模テストでは15ミリ秒で動作する。
- 優先度が均一な場合でも、システムは利用率を76.8%から87.5%に改善し、ホライズンプランニングが優先度加重のみを超えて利益をもたらすことを示した。
到着順に依存するのではなく、全体のスケジューリングホライズンにわたって割り当て判断を最適化することで、このアロケータは静的な予約によるアイドル容量を防ぎ、高優先度のワークロードを効率的にスケジュールすることを保証する。