A Together lançou uma atualização significativa para sua plataforma de inferência, introduzindo a "Inferência de Modelo Dedicada" projetada para dar aos usuários controle total sobre desempenho, custo e qualidade para modelos de pesos abertos. A atualização também anuncia um beta fechado para capacidades de treinamento personalizado, incluindo reforço com pesos completos e LoRA.

  • Implantações suportam atualizações canário, azul-verde e contínuas com reversão automática em caso de violação de limites.
  • Testes A/B e sombra permitem a avaliação de novos pesos contra o tráfego real sem impactar os usuários.
  • As camadas de cache e distribuição de modelos foram reconstruídas para oferecer tempos de inicialização aproximadamente 4× mais rápidos.
  • O dimensionamento automático suporta métricas como solicitações em andamento, utilização de GPU e tempo até o primeiro token.
  • O beta de treinamento personalizado inclui ajuste fino supervisionado com checkpoints implantáveis diretamente em produção.

A plataforma visa simplificar a transição da experimentação para a produção, gerenciando o ciclo de vida das implantações e a observabilidade, permitindo que as equipes itere semanalmente nas versões dos modelos com segurança.