ThunderAgent est un système qui introduit une abstraction de programme pour l'ordonnancement des requêtes LLM agnostiques afin de résoudre le thrashing du cache KV dans la génération de données synthétiques à haute concurrence. En traitant les workflows d'agent comme des programmes ordonnançables plutôt que comme des requêtes indépendantes, il améliore considérablement le débit et réduit la latence.

  • Atteint un débit par nœud jusqu'à 2,5× supérieur et une latence P50 10× inférieure à haute concurrence par rapport aux ordonnanceurs SGLang par défaut.
  • Offre un gain de vitesse de 2,4× sur un cluster de 8 nœuds avec une mise à l'échelle quasi linéaire du débit de 16 à 64 GPU.
  • Atténue le thrashing du cache KV grâce au contrôle d'admission au niveau du programme et à une file d'attente globale pour l'équilibrage de charge.
  • Compatible avec les stratégies de déchargement existantes comme HiCache et le décodage spéculatif via des points de terminaison compatibles OpenAI.

Le système permet aux utilisateurs d'adopter des optimisations d'inférence agnostique sans modifier leur backend d'inférence sous-jacent, offrant une scalabilité pratique pour les pipelines d'entraînement d'agents à grande échelle.