L'article décrit une méthode pour consolider le trafic provenant de plus de 200 applications internes vers un seul grand modèle de langage (LLM) auto-hébergé afin de répondre aux contraintes de résidence des données et à la fragmentation des GPU. L'approche comble les écarts de qualité en matière de suivi des instructions, d'appel de fonctions et de distribution des tâches internes en entraînant des experts GRPO distincts par axe et en les fusionnant via un SLERP en deux étapes.
- La qualité est suivie à l'aide de benchmarks hors ligne stratifiés selon le trafic de production et évalués par des vérificateurs déterministes ou des juges LLM calibrés.
- Des experts GRPO distincts traitent des modes d'échec spécifiques : effondrement sémantique, sur-appel et contournement par verbosité.
- Le modèle consolidé dépasse une baseline environ 7 fois plus grande en nombre total de paramètres sur les benchmarks internes.
- Les améliorations spécifiques incluent des scores Arena de 69,6 contre 65,8, un suivi des instructions de 0,85 contre 0,83 et un appel de fonctions de 0,79 contre 0,77.
Le modèle consolidé absorbe 50 % du trafic de la plateforme, gérant 116 millions de requêtes par mois à une fraction du coût de service.