A Together AI introduziu um recurso na plataforma que permite às equipes executar experimentos A/B em endpoints ativos, dividindo o tráfego entre um controle e até 20 variantes para medir o desempenho do modelo candidato com usuários reais.

  • Os experimentos são vinculados a um endpoint, subdividindo a parcela de tráfego do controle entre os braços, enquanto exigem que as implantações das variantes tenham peso zero na divisão base.
  • As parcelas de tráfego são porcentagens fixas independentes da contagem de réplicas, garantindo medição consistente independentemente do escalonamento automático.
  • O aumento gradual é tratado atualizando o conjunto de membros com um guardião etag para evitar substituições silenciosas, permitindo testes multi-via com até 20 variantes.
  • A plataforma fornece métricas de infraestrutura por implantação e exige que os usuários juntem os metadados da resposta aos seus próprios sinais de qualidade do produto.
  • Os experimentos podem ser encerrados promovendo o vencedor por meio de rollout blue-green ou excluindo o experimento para retornar todo o tráfego ao controle.

Este recurso permite que as equipes determinem se um novo modelo melhora a retenção de usuários ou as taxas de conclusão de tarefas, evitando as armadilhas da lógica de roteamento manual no lado do cliente que pode derivar ou persistir após o fim dos experimentos.