ThunderAgent es un sistema que introduce una abstracción de programa para la programación de solicitudes LLM agentes con el fin de abordar el thrashing del caché KV en la generación de datos sintéticos de alta concurrencia. Al tratar los flujos de trabajo de agentes como programas programables en lugar de solicitudes independientes, mejora significativamente el rendimiento y reduce la latencia.

  • Logra hasta 2.5× mayor rendimiento por nodo y 10× menor latencia P50 a alta concurrencia en comparación con los programadores predeterminados de SGLang.
  • Ofrece una aceleración de 2.4× en un clúster de 8 nodos con escalado de rendimiento casi lineal de 16 a 64 GPUs.
  • Mitiga el thrashing del caché KV mediante control de admisión a nivel de programa y una cola de espera global para equilibrar la carga.
  • Compatible con estrategias de descargo existentes como HiCache y decodificación especulativa a través de puntos finales compatibles con OpenAI.

El sistema permite a los usuarios adoptar optimizaciones de inferencia agente sin cambiar su backend de inferencia subyacente, ofreciendo escalabilidad práctica para pipelines de entrenamiento de agentes a gran escala.