Together AI добавила возможности автоскейлинга в свою плат Dedicated Model Inference, позволяя развертываниям масштабироваться на основе метрик, которые понимает движок инференса, таких как находящиеся в обработке запросы, время до первого токена (TTFT) и использование GPU.
- Система использует контур пропорционального управления с настраиваемыми границами реплик и временными окнами для управления масштабированием вверх и вниз.
- Пользователи могут выбирать из восьми метрик, разделенных на категории: управляемые конкурентностью (например, inflight_requests), управляемые SLO (например, ttft) или управляемые эффективностью (например, gpu_utilization).
- Метрики, управляемые конкурентностью, рекомендуются по умолчанию, поскольку они служат опережающими индикаторами нагрузки до того, как задержка начнет ухудшаться.
- Платформа не поддерживает автоматическое масштабирование до нуля; явное задание минимального и максимального количества реплик равным 0 останавливает развертывание.
- Эксперимент с моделью Qwen3.5-9B показал, что только метрика inflight_requests успешно масштабировалась во время всплесков трафика, в то время как политики TTFT и использования GPU не отреагировали.
Автоскейлинг помогает балансировать между стоимостью и производительностью, предотвращая избыточное выделение простаивающих GPU и недостаточное выделение, которое приводит к сильному ухудшению задержки в периоды пиковой нагрузки.