A Together AI detalha a arquitetura de sua plataforma de Inferência Dedicada de Modelos, que conecta endpoints, implantações e configurações imutáveis por meio de uma divisão de tráfego consciente da capacidade. Este sistema roteia solicitações com base na capacidade efetiva (peso multiplicado por réplicas prontas) em vez de porcentagens fixas, permitindo recursos como lançamentos sem tempo de inatividade e testes A/B.

  • As configurações especificam o mecanismo, o tipo de GPU e os perfis de otimização (latência, vazão ou equilibrado) e são imutáveis para evitar deriva do comportamento.
  • As implantações vinculam uma revisão específica do modelo a uma configuração e gerenciam políticas de escalonamento automático para as réplicas.
  • Os endpoints fornecem uma identidade estável para os clientes, usando divisões de tráfego para distribuir a carga entre as implantações proporcionalmente à sua capacidade.
  • A plataforma suporta coortes A/B e lançamentos canário que se compõem com a lógica básica de roteamento.

O artigo demonstra como esse modelo evita problemas de saturação durante o escalonamento e destaca a importância de testar perfis como latência versus vazão em diferentes níveis de concorrência para evitar paralisações na produção.