ThunderAgent는 높은 동시성 합성 데이터 생성에서 KV 캐시 스래싱 문제를 해결하기 위해 에이전트 LLM 요청 스케줄링을 위한 프로그램 추상화를 도입한 시스템입니다. 에이전트 워크플로우를 독립적인 요청이 아닌 스케줄 가능한 프로그램으로 처리함으로써 처리량을 크게 향상시키고 지연 시간을 줄입니다.

  • 기본 SGLang 스케줄러와 비교하여 높은 동시성에서 단일 노드 처리량을 최대 2.5배 높이고 P50 지연 시간을 10배 낮춥니다.
  • 16개 GPU에서 64개 GPU로 확장할 때 선형에 가까운 처리량 확장을 보여주며, 8개 노드 클러스터에서 2.4배의 속도 향상을 제공합니다.
  • 프로그램 수준 허용 제어와 부하 균형을 위한 전역 대기열을 통해 KV 캐시 스래싱을 완화합니다.
  • OpenAI 호환 엔드포인트를 통해 HiCache 및 추론적 디코딩과 같은 기존 오프로딩 전략과 호환됩니다.

이 시스템은 사용자들이 기본 추론 백엔드를 변경하지 않고도 에이전트 추론 최적화를 채택할 수 있도록 하며, 대규모 에이전트 학습 파이프라인에 실용적인 확장성을 제공합니다.