Together AI detalla la arquitectura de su plataforma de Inferencia de Modelos Dedicados, que conecta puntos finales, implementaciones y configuraciones inmutables mediante una división de tráfico consciente de la capacidad. Este sistema enruta las solicitudes en función de la capacidad efectiva (peso multiplicado por réplicas listas) en lugar de porcentajes fijos, lo que habilita funciones como despliegues sin tiempo de inactividad y pruebas A/B.

  • Las configuraciones especifican el motor, el tipo de GPU y los perfiles de optimización (latencia, rendimiento o equilibrado) e son inmutables para evitar la deriva del comportamiento.
  • Las implementaciones vinculan una revisión específica del modelo a una configuración y gestionan las políticas de escalado automático para las réplicas.
  • Los puntos finales proporcionan una identidad estable para los clientes, utilizando divisiones de tráfico para distribuir la carga entre las implementaciones proporcionalmente a su capacidad.
  • La plataforma admite cohortes A/B y despliegues canario que se componen con la lógica básica de enrutamiento.

El artículo demuestra cómo este modelo previene problemas de saturación durante el escalado y destaca la importancia de probar perfiles como la latencia frente al rendimiento a diferentes niveles de concurrencia para evitar bloqueos en producción.