ThunderAgent — это система, которая вводит абстракцию программы для планирования запросов агентов LLM с целью устранения фрагментации KV-кэша при генерации синтетических данных с высокой степенью параллелизма. Рассматривая рабочие процессы агентов как планируемые программы, а не независимые запросы, она значительно повышает пропускную способность и снижает задержку.
- Обеспечивает до 2,5× более высокую однокластерную пропускную способность и в 10 раз меньшую P50 задержку при высокой степени параллелизма по сравнению с планировщиками SGLang по умолчанию.
- Демонстрирует ускорение в 2,4 раза на кластере из 8 узлов с почти линейным масштабированием пропускной способности от 16 до 64 GPU.
- Снижает фрагментацию KV-кэша за счёт контроля допуска на уровне программы и глобальной очереди ожидания для балансировки нагрузки.
- Совместим с существующими стратегиями выгрузки, такими как HiCache и спекулятивное декодирование, через OpenAI-совместимые конечные точки.
Система позволяет пользователям внедрять оптимизации агентного вывода без изменения базового бэкенда вывода, обеспечивая практическое масштабирование для конвейеров обучения агентов в больших масштабах.