O artigo descreve um método para consolidar o tráfego de mais de 200 aplicativos internos em um único modelo de linguagem grande (LLM) auto-hospedado, a fim de atender às restrições de residência de dados e à fragmentação de GPUs. A abordagem preenche as lacunas de qualidade na execução de instruções, chamada de funções e distribuição de tarefas internas, treinando especialistas GRPO separados por eixo e mesclando-os por meio de SLERP em duas etapas.
- A qualidade é monitorada usando benchmarks offline estratificados conforme o tráfego de produção e pontuados por verificadores determinísticos ou juízes LLM calibrados.
- Especialistas GRPO separados abordam modos específicos de falha: colapso semântico, excesso de chamadas e exploração da verbosidade.
- O modelo resultante supera uma linha de base aproximadamente 7 vezes maior em parâmetros totais nos benchmarks internos.
- As melhorias específicas incluem pontuações na Arena de 69,6 contra 65,8, execução de instruções de 0,85 contra 0,83 e chamada de funções de 0,79 contra 0,77.
O modelo consolidado absorve 50% do tráfego da plataforma, processando 116 milhões de solicitações por mês a uma fração do custo de serviço.