Together a publié une mise à jour majeure de sa plateforme d'inférence, introduisant « Dedicated Model Inference » conçu pour offrir aux utilisateurs un contrôle total sur les performances, les coûts et la qualité des modèles à poids ouverts. La mise à jour annonce également un bêta fermé pour les capacités d'entraînement personnalisé, incluant le renforcement par apprentissage avec des poids complets et LoRA.

  • Les déploiements prennent en charge les mises à jour canari, bleu-vert et progressives avec un retour arrière automatique en cas de dépassement de seuil.
  • Les tests A/B et en mode ombre permettent d'évaluer de nouveaux poids par rapport au trafic réel sans impacter les utilisateurs.
  • Les couches de mise en cache des modèles et de distribution ont été reconstruites pour offrir des démarrages à froid environ 4× plus rapides.
  • L'autoscaling prend en charge des métriques telles que les requêtes en cours, l'utilisation du GPU et le temps jusqu'au premier jeton.
  • Le bêta d'entraînement personnalisé inclut le réglage fin supervisé avec des points de contrôle déployables directement en production.

La plateforme vise à simplifier la transition de l'expérimentation à la production en gérant le cycle de vie du déploiement et l'observabilité, permettant aux équipes d'itérer en toute sécurité sur les versions de modèles chaque semaine.