O ThunderAgent é um sistema que introduz uma abstração de programa para o escalonamento de solicitações de LLM agêntico, visando mitigar a oscilação do cache KV na geração de dados sintéticos de alta concorrência. Ao tratar fluxos de trabalho de agentes como programas escalonáveis em vez de solicitações independentes, ele melhora significativamente a taxa de transferência e reduz a latência.

  • Alcança até 2,5× maior taxa de transferência por nó único e 10× menor latência P50 em alta concorrência em comparação com os escalonadores padrão do SGLang.
  • Oferece aceleração de 2,4× em um cluster de 8 nós com escalonamento de taxa de transferência quase linear de 16 para 64 GPUs.
  • Mitiga a oscilação do cache KV por meio de controle de admissão em nível de programa e uma fila de espera global para balanceamento de carga.
  • Compatível com estratégias de descarregamento existentes, como HiCache e decodificação especulativa, por meio de endpoints compatíveis com OpenAI.

O sistema permite que os usuários adotem otimizações de inferência agêntica sem alterar seu backend de inferência subjacente, oferecendo escalabilidade prática para pipelines de treinamento de agentes em larga escala.