ThunderAgentは、高同時実行の合成データ生成におけるKVキャッシュのスラッシングに対処するため、エージェントLLMリクエストのスケジューリングにプログラム抽象化を導入するシステムです。エージェントワークフローを独立したリクエストではなくスケジューリング可能なプログラムとして扱うことで、スループットを大幅に向上させ、レイテンシを削減します。

  • デフォルトのSGLangスケジューラと比較して、高同時実行時にシングルノードのスループットが最大2.5倍向上し、P50レイテンシが10倍低減します。
  • 16から64 GPUまでほぼ線形にスケーリングするスループットを実現し、8ノードクラスターで2.4倍の高速化を提供します。
  • プログラムレベルのアドミッションコントロールと負荷分散用のグローバル待機キューを通じてKVキャッシュのスラッシングを軽減します。
  • OpenAI互換エンドポイントを介してHiCacheや推測的デコーディングなどの既存のオフロード戦略と互換性があります。

このシステムにより、ユーザーは基盤となる推論バックエンドを変更せずにエージェント推論の最適化を採用でき、大規模なエージェントトレーニングパイプラインに対して実用的なスケーラビリティを提供します。