A Together AI adicionou capacidades de escalonamento automático à sua plataforma de Inferência Dedicada de Modelos, permitindo que as implantações escalem com base em métricas compreendidas pelo mecanismo de inferência, como solicitações em andamento, tempo até o primeiro token (TTFT) e utilização da GPU.

  • O sistema utiliza um loop de controle proporcional com limites configuráveis de réplicas e janelas de tempo para gerenciar o aumento e a diminuição do escalonamento.
  • Os usuários podem escolher entre oito métricas, categorizadas como orientadas à concorrência (por exemplo, inflight_requests), orientadas a SLO (por exemplo, ttft) ou orientadas à eficiência (por exemplo, gpu_utilization).
  • Métricas orientadas à concorrência são recomendadas como padrão porque servem como indicadores antecipados de carga antes que a latência se degrade.
  • A plataforma não oferece suporte ao escalonamento automático para zero; definir as réplicas mínimas e máximas como 0 interrompe explicitamente a implantação.
  • Um experimento com um modelo Qwen3.5-9B mostrou que apenas a métrica inflight_requests conseguiu escalar durante picos de tráfego, enquanto as políticas de TTFT e utilização da GPU falharam em reagir.

O escalonamento automático ajuda a equilibrar custo e desempenho, evitando o superdimensionamento de GPUs ociosas e o subdimensionamento que leva à degradação severa da latência durante o pico de tráfego.