शोधकर्ताओं ने SocialRL पेश किया, एक प्रशिक्षण विधि जो छोटे भाषा मॉडल्स में सामाजिक तर्क को सीधे पुष्टि करती है ताकि उन्हें रणनीतिक वार्ताकार के रूप में उनकी कार्यक्षमता में सुधार किया जा सके। Deal-or-No-Deal और जॉब इंटरव्यू सहित छह डोमेन पर 4B मॉडल पर लागू, यह दृष्टिकोण मॉडल को बंद किए गए परिदृश्यों पर GPT-5 परिवार की कार्यक्षमता के बराबर या उससे अधिक होने में सक्षम बनाता है।

  • डोमेन-इन प्रशिक्षण बेलाइन से फ्रंटियर अंतर का 73-122% बंद करता है, जिसमें खरीदारों के खुले पक्षों का 78% लक्ष्य से नीचे एंकर होता है, जबकि बिना प्रशिक्षित मॉडल्स के लिए यह 3% है।
  • क्रॉस-डोमेन स्थानांतरण गेम संरचना पर निर्भर करता है, जहां संरचनात्मक रूप से जुड़े गेम एक-दूसरे को बढ़ावा देते हैं जबकि अलग-अलग गेम स्थानांतरित नहीं होते।
  • कैस्केड RL और मल्टी-टीचर ऑन-पॉलिसी डिस्टिलेशन विशेषज्ञों को एक एकीकृत 4B मॉडल में संघबद्ध करते हैं जो 0.627 औसत उपयोगिता प्राप्त करता है, जिससे GPT-4.1 (0.625) और GPT-5.2 (0.613) को पार कर जाता है।
  • केवल कार्यों के बजाय थ्योरी-ऑफ-माइंड ट्रेस को डिस्टिल करने से उपयोगिता और सामान्यीकरण में सुधार होता है, जिसमें अगले-कार्य की भविष्यवाणी परिणाम भविष्यवाणी के लिए मुख्य कौशल है।

अध्ययन दिखाता है कि छोटे मॉडल सीधे सामाजिक तर्क प्रशिक्षण और प्रभावी क्रॉस-डोमेन संघीकरण रणनीतियों के माध्यम से फ्रंटियर-स्तर की वार्ता क्षमताएं प्राप्त कर सकते हैं।