Together ha lanzado una actualización significativa para su plataforma de inferencia, presentando "Inferencia de Modelo Dedicada" diseñada para dar a los usuarios control total sobre el rendimiento, el costo y la calidad de los modelos de peso abierto. La actualización también anuncia una beta cerrada para capacidades de entrenamiento personalizado, incluyendo refuerzo con pesos completos y LoRA.
- Las implementaciones admiten actualizaciones canario, azul-verde y progresivas con retroceso automático ante incumplimientos de umbrales.
- Las pruebas A/B y sombra permiten evaluar nuevos pesos frente al tráfico real sin afectar a los usuarios.
- Las capas de caché de modelos y distribución se reconstruyeron para ofrecer tiempos de inicio en frío aproximadamente 4× más rápidos.
- El escalado automático admite métricas como solicitudes en curso, utilización de GPU y tiempo hasta el primer token.
- La beta de entrenamiento personalizado incluye ajuste fino supervisado con puntos de control desplegables directamente a producción.
La plataforma tiene como objetivo simplificar la transición de la experimentación a la producción gestionando la gestión del ciclo de vida del despliegue y la observabilidad, permitiendo a los equipos iterar semanalmente en las versiones de modelos de forma segura.