本記事は、データ居住性制約とGPUの断片化に対処するため、200以上の内部アプリケーションからのトラフィックを単一の自前ホスト大規模言語モデルに統合する方法を説明しています。このアプローチは、指示のフォロー、関数呼び出し、内部タスク配分における品質のギャップを、軸ごとに個別のGRPOエキスパートをトレーニングし、2段階のSLERPでマージすることで埋めます。

  • 品質は、プロダクショントラフィックに層別化されたオフラインベンチマークで追跡され、決定論的検証者または較正済みLLMジャッジによってスコアリングされます。
  • 個別のGRPOエキスパートは、特定の失敗モード(意味崩壊、過剰な呼び出し、冗長性ハッキング)に対処します。

結果として得られたモデルは、内部ベンチマークにおいて総パラメータ数で約7倍大きいベースラインを上回ります。

  • 具体的な改善点としては、Arenaスコアが69.6対65.8、指示フォローが0.85対0.83、関数呼び出しが0.79対0.77となっています。

統合されたモデルはプラットフォームトラフィックの50%を吸収し、サービングコストの大幅な削減で月間1億1600万リクエストを処理しています。