ThunderAgent adalah sistem yang memperkenalkan abstraksi program untuk penjadwalan permintaan LLM agentik guna mengatasi thrashing cache KV dalam generasi data sintetis ber-konkurensi tinggi. Dengan memperlakukan alur kerja agen sebagai program yang dapat dijadwalkan daripada permintaan independen, sistem ini secara signifikan meningkatkan throughput dan mengurangi latensi.

  • Mencapai throughput per-node hingga 2,5× lebih tinggi dan latensi P50 10× lebih rendah pada konkurensi tinggi dibandingkan penjadwal default SGLang.
  • Memberikan percepatan 2,4× pada kluster 8-node dengan skalabilitas throughput hampir linear dari 16 hingga 64 GPU.
  • Meredam thrashing cache KV melalui kontrol adisi tingkat program dan antrian tunggu global untuk penyeimbangan beban.
  • Kompatibel dengan strategi offloading yang ada seperti HiCache dan decoding spekulatif melalui endpoint yang kompatibel dengan OpenAI.

Sistem ini memungkinkan pengguna mengadopsi optimasi inferensi agentik tanpa mengubah backend inferensi dasar mereka, menawarkan skalabilitas praktis untuk alur pelatihan agen skala besar.