Fuente · Together AI Blog
media Together AI Blog · hace 26 d · 53 vistas

La destilación de GLM-5.3 Flash intercambia consistencia por una reducción de costo de 17x

Una comparación de GLM-5.3 y su variante destilada, GLM-5.3 Flash, en el benchmark DeepSWE revela que la destilación preserva la capacidad central de codificación mientras reduce significativamente los costos de rollout. El modelo completo logra una tasa de pass@1 del 69.0% a $3.99 por tarea, mientras que la variante Flash obtiene un puntaje de 63.4% a solo $0.24, lo que representa una reducción de precio de 17x.

media Together AI Blog · hace 2 d · 12 vistas

Together AI introduce despliegues Canary para actualizar modelos en producción sin tiempo de inactividad

Together AI ha introducido los despliegues Canary, una función que migra el tráfico en vivo desde un modelo actual a un nuevo punto de control en pasos con compuerta. Este sistema automatiza el mecanismo de seguridad para intercambiar modelos ejecutando comprobaciones de salud y compuertas de métricas opcionales antes de mover el tráfico, lo que permite pausas y reversiones automáticas si el rendimiento se degrada.

media Together AI Blog · hace 8 d · 18 vistas

Together esboza la estrategia para migrar de modelos propietarios a de código abierto

Together proporciona un marco para que las empresas migren de modelos de IA propietarios a modelos de código abierto (OSM) utilizando servicios gestionados, con el objetivo de reducir la complejidad y acelerar la adopción. El proceso implica descubrir modelos adecuados mediante benchmarks, evaluarlos mediante la repetición del tráfico, adaptar los prompts o los pesos, y calcular el ROI para justificar el cambio.