Together AI ha añadido capacidades de escalado automático a su plataforma de Inferencia Dedicada de Modelos, permitiendo que los despliegues se escale según métricas que el motor de inferencia comprende, como solicitudes en curso, tiempo hasta el primer token (TTFT) y utilización de GPU.
- El sistema utiliza un bucle de control proporcional con límites de réplicas configurables y ventanas temporales para gestionar el escalado hacia arriba y hacia abajo.
- Los usuarios pueden elegir entre ocho métricas, categorizadas como impulsadas por concurrencia (por ejemplo, inflight_requests), impulsadas por SLO (por ejemplo, ttft) o impulsadas por eficiencia (por ejemplo, gpu_utilization).
- Se recomiendan las métricas impulsadas por concurrencia como predeterminadas porque sirven como indicadores anticipados de carga antes de que la latencia se degrade.
- La plataforma no admite escalado automático a cero; establecer min y max replicas en 0 detiene explícitamente el despliegue.
- Un experimento con un modelo Qwen3.5-9B mostró que solo la métrica inflight_requests escaló correctamente durante picos de tráfico, mientras que las políticas de TTFT y gpu_utilization no lograron reaccionar.
El escalado automático ayuda a equilibrar costo y rendimiento evitando el sobreaprovisionamiento de GPUs inactivas y el subaprovisionamiento que provoca una degradación severa de la latencia durante picos de tráfico.