ThunderAgent 是一个引入程序抽象以进行智能体 LLM 请求调度的系统,旨在解决高并发合成数据生成中的 KV 缓存抖动问题。通过将智能体工作流视为可调度程序而非独立请求,它显著提高了吞吐量并降低了延迟。

  • 与默认 SGLang 调度器相比,在高并发情况下实现高达2.5倍的单节点吞吐量和10倍的P50延迟降低。
  • 在8节点集群上提供2.4倍加速,从16到64个GPU的吞吐量呈近线性扩展。
  • 通过程序级准入控制和用于负载均衡的全局等待队列缓解 KV 缓存抖动。
  • 通过 OpenAI 兼容端点与现有卸载策略(如 HiCache)和推测性解码兼容。

该系统允许用户在不更改底层推理后端的采用智能体推理优化,为大规模智能体训练管道提供实际的可扩展性。