본 기사는 데이터 거주 요건과 GPU 단편화 문제를 해결하기 위해 200개 이상의 내부 애플리케이션에서 트래픽을 단일 자체 호스팅 대규모 언어 모델로 통합하는 방법을 설명합니다. 이 접근 방식은 축별로 별도의 GRPO 전문가를 훈련하고 두 단계의 SLERP로 병합함으로써 지시 따르기, 함수 호출 및 내부 작업 분배의 품질 격차를 해소합니다.

  • 품질은 프로덕션 트래픽에 계층화된 오프라인 벤치마크를 사용하여 추적하며, 결정론적 검증자나 보정된 LLM 판정자가 점수를 매깁니다.
  • 별도의 GRPO 전문가는 의미적 붕괴, 과도한 호출 및 장황함 해킹이라는 특정 실패 모드를 해결합니다.

결과적으로 생성된 모델은 내부 벤치마크에서 총 파라미터 수 기준 약 7배 더 큰 베이스라인을 능가합니다.

  • 구체적인 개선 사항으로는 Arena 점수 69.6 대 65.8, 지시 따르기 0.85 대 0.83, 함수 호출 0.79 대 0.77이 있습니다.

통합된 모델은 플랫폼 트래픽의 50%를 흡수하며, 서빙 비용의 극히 일부로 월 1억 1600만 건의 요청을 처리합니다.