يقدم الباحثون SocialRL، وهو وصفة تدريب تعزز مباشرة الاستدلال الاجتماعي في نماذج اللغة الصغيرة لتحسين أدائها كمفاوضين استراتيجيين. عند تطبيقها على نموذج بحجم 4B عبر ست مجالات تشمل Deal-or-No-Deal ومقابلة العمل، تتيح هذه الطريقة للنموذج أن يوازي أو يتفوق على أداء عائلة GPT-5 في السيناريوهات المحجوبة.

  • يغلق التدريب ضمن المجال ما بين 73% و122% من الفجوة بين الأساس وأعلى مستوى، مع تثبيت 78% من عروض المشترين تحت الهدف مقارنة بـ 3% للنماذج غير المدربة.
  • يعتمد النقل عبر المجالات على هيكل اللعبة، حيث ترفع الألعاب المتزاوجة هيكلياً من أداء بعضها البعض بينما لا تنتقل الألعاب المعزولة.
  • يدمج الـ Cascade RL والتقطير متعدد المعلمين في السياق المباشر المتخصصين في نموذج موحد بحجم 4B يحقق متوسط منفعة قدره 0.627، متفوقاً على GPT-4.1 (0.625) وGPT-5.2 (0.613).
  • يؤدي تقطيع آثار نظرية العقل بدلاً من الأفعال وحدها إلى تحسين المنفعة والتعميم، مع كون التنبؤ بالخطوة التالية المهارة الأساسية للتنبؤ بالنتائج.

تُظهر الدراسة أن النماذج الصغيرة يمكنها تحقيق قدرات تفاوض على مستوى الواجهة الأمامية من خلال التدريب المباشر للاستدلال الاجتماعي واستراتيجيات الدمج الفعالة عبر المجالات.