تصف المقالة طريقة لتوحيد حركة المرور من أكثر من 200 تطبيق داخلي على نموذج لغوي كبير واحد مستضاف ذاتياً لمعالجة قيود إقامة البيانات والتجزئة في وحدات معالجة الرسومات. تغلق هذه النهج فجوات الجودة في اتباع التعليمات، استدعاء الوظائف، وتوزيع المهام الداخلية عن طريق تدريب خبراء GRPO منفصلين لكل محور ودمجهم عبر مرحلتين من SLERP.

  • يتم تتبع الجودة باستخدام مقاييس تقييم غير متصلة مصفاة وفقاً لحركة المرور الإنتاجية ومُقيّمة بواسطة مُحقِّقات حتمية أو قضاة LLM معايرين.
  • يتناول خبراء GRPO المنفصلون أنماط الفشل المحددة: الانهيار الدلالي، الإفراط في الاستدعاء، والاختراق اللفظي.
  • يتفوق النموذج الموحّد على خط الأساس الذي يحتوي على حوالي 7 أضعاف المعلمات الإجمالية في المقاييس الداخلية.
  • تشمل التحسينات المحددة درجات Arena البالغة 69.6 مقابل 65.8، واتباع التعليمات بنسبة 0.85 مقابل 0.83، واستدعاء الوظائف بنسبة 0.79 مقابل 0.77.

يمتص النموذج الموحّد 50% من حركة المرور على المنصة، مع معالجة 116 مليون طلب شهرياً بكسر بسيط من تكلفة التقديم.