El artículo describe un método para consolidar el tráfico de más de 200 aplicaciones internas en un único modelo de lenguaje grande autoalojado, con el fin de abordar las restricciones de residencia de datos y la fragmentación de GPU. El enfoque cierra las brechas de calidad en el seguimiento de instrucciones, la llamada de funciones y la distribución de tareas internas mediante el entrenamiento de expertos GRPO separados por eje y su fusión mediante SLERP en dos etapas.

  • La calidad se rastrea utilizando benchmarks offline estratificados según el tráfico de producción y puntuados por verificadores deterministas o jueces LLM calibrados.
  • Los expertos GRPO separados abordan modos de fallo específicos: colapso semántico, sobrellamada y hacking de verbosidad.
  • El modelo resultante supera a una línea base aproximadamente 7 veces mayor en parámetros totales en los benchmarks internos.
  • Las mejoras específicas incluyen puntuaciones de Arena de 69.6 frente a 65.8, seguimiento de instrucciones de 0.85 frente a 0.83 y llamada de funciones de 0.79 frente a 0.77.

El modelo consolidado absorbe el 50% del tráfico de la plataforma, gestionando 116 millones de solicitudes por mes con una fracción del coste de servicio.