Together AI добавила возможности автоскейлинга в свою плат Dedicated Model Inference, позволяя развертываниям масштабироваться на основе метрик, которые понимает движок инференса, таких как находящиеся в обработке запросы, время до первого токена (TTFT) и использование GPU.

  • Система использует контур пропорционального управления с настраиваемыми границами реплик и временными окнами для управления масштабированием вверх и вниз.
  • Пользователи могут выбирать из восьми метрик, разделенных на категории: управляемые конкурентностью (например, inflight_requests), управляемые SLO (например, ttft) или управляемые эффективностью (например, gpu_utilization).
  • Метрики, управляемые конкурентностью, рекомендуются по умолчанию, поскольку они служат опережающими индикаторами нагрузки до того, как задержка начнет ухудшаться.
  • Платформа не поддерживает автоматическое масштабирование до нуля; явное задание минимального и максимального количества реплик равным 0 останавливает развертывание.
  • Эксперимент с моделью Qwen3.5-9B показал, что только метрика inflight_requests успешно масштабировалась во время всплесков трафика, в то время как политики TTFT и использования GPU не отреагировали.

Автоскейлинг помогает балансировать между стоимостью и производительностью, предотвращая избыточное выделение простаивающих GPU и недостаточное выделение, которое приводит к сильному ухудшению задержки в периоды пиковой нагрузки.