Together AI détaille l'architecture de sa plateforme d'Inférence de Modèles Dédiés, qui relie les points de terminaison, les déploiements et les configurations immuables via un partage de trafic conscient de la capacité. Ce système achemine les requêtes en fonction de la capacité effective (poids multiplié par le nombre de réplicas prêts) plutôt que sur des pourcentages fixes, permettant des fonctionnalités telles que les déploiements sans interruption et les tests A/B.
- Les configurations spécifient le moteur, le type de GPU et les profils d'optimisation (latence, débit ou équilibré) et sont immuables pour empêcher la dérive du comportement.
- Les déploiements lient une révision spécifique du modèle à une configuration et gèrent les politiques de mise à l'échelle automatique pour les réplicas.
- Les points de terminaison fournissent une identité stable pour les clients, en utilisant des partages de trafic pour répartir la charge entre les déploiements proportionnellement à leur capacité.
- La plateforme prend en charge les cohortes A/B et les déploiements canari qui s'articulent avec la logique de routage de base.
L'article démontre comment ce modèle évite les problèmes de saturation lors de la mise à l'échelle et souligne l'importance de tester des profils tels que la latence par rapport au débit à différents niveaux de concurrence pour éviter les blocages en production.