В статье описывается метод консолидации трафика от более чем 200 внутренних приложений на одном самохостинговом большой языковой модели для решения проблем соответствия требованиям резидентности данных и фрагментации GPU. Подход устраняет разрывы в качестве выполнения инструкций, вызова функций и распределения внутренних задач путем обучения отдельных экспертов GRPO по каждой оси и их объединения с помощью двухэтапного SLERP.
- Качество отслеживается с помощью офлайн-бенчмарков, стратифицированных по производственному трафику, и оценивается детерминированными верификаторами или калиброванными судьями LLM.
- Отдельные эксперты GRPO решают специфические режимы отказов: семантический коллапс, чрезмерный вызов функций и хакинг многословности.
- Полученная модель превосходит базовую примерно в 7 раз большую по общему количеству параметров на внутренних бенчмарках.
- Конкретные улучшения включают оценки Arena 69.6 против 65.8, выполнение инструкций 0.85 против 0.83 и вызов функций 0.79 против 0.77.
Консолидированная модель поглощает 50% платформенного трафика, обрабатывая 116 миллионов запросов в месяц за долю от стоимости обслуживания.