Together AI a ajouté des capacités d'auto-mise à l'échelle à sa plateforme Dedicated Model Inference, permettant aux déploiements de s'adapter en fonction de métriques comprises par le moteur d'inférence, telles que les requêtes en cours, le temps jusqu'au premier jeton (TTFT) et l'utilisation du GPU.
- Le système utilise une boucle de contrôle proportionnelle avec des bornes de répliques configurables et des fenêtres temporelles pour gérer la montée et la descente en charge.
- Les utilisateurs peuvent choisir parmi huit métriques, classées comme pilotées par la concurrence (par exemple, inflight_requests), pilotées par les SLO (par exemple, ttft) ou pilotées par l'efficacité (par exemple, gpu_utilization).
- Les métriques pilotées par la concurrence sont recommandées par défaut car elles servent d'indicateurs avancés de charge avant que la latence ne se dégrade.
- La plateforme ne prend pas en charge la mise à l'échelle automatique vers zéro ; définir les répliques min et max à 0 arrête explicitement le déploiement.
- Une expérience avec un modèle Qwen3.5-9B a montré que seule la métrique inflight_requests a réussi à s'adapter lors des pics de trafic, tandis que les politiques TTFT et gpu_utilization n'ont pas réagi.
L'auto-mise à l'échelle aide à équilibrer le coût et les performances en empêchant la sur-provisionnement de GPUs inactifs et le sous-provisionnement qui entraîne une dégradation sévère de la latence lors des pics de trafic.