Para peneliti memaparkan SocialRL, sebuah resep pelatihan yang secara langsung memperkuat penalaran sosial pada model bahasa kecil untuk meningkatkan kinerja mereka sebagai negosiator strategis. Diterapkan pada model 4B di enam domain termasuk Deal-or-No-Deal dan Wawancara Kerja, pendekatan ini memungkinkan model menyamai atau melampaui kinerja keluarga GPT-5 pada skenario yang diisolasi.

  • Pelatihan dalam-domain menutupi kesenjangan baseline-ke-frontier sebesar 73-122%, dengan 78% pembukaan pembeli berjangkar di bawah target dibandingkan 3% untuk model yang tidak dilatih.
  • Transfer lintas-domain bergantung pada struktur permainan, di mana permainan yang dipasangkan secara struktural saling meningkatkan sementara permainan terisolasi tidak mentransfer.
  • Cascade RL dan distilasi on-policy multi-guru mengonsolidasikan spesialis menjadi satu model 4B terpadu yang mencapai utilitas rata-rata 0.627, melampaui GPT-4.1 (0.625) dan GPT-5.2 (0.613).
  • Mendistilasi jejak teori-mind daripada hanya tindakan meningkatkan utilitas dan generalisasi, dengan prediksi tindakan berikutnya menjadi keterampilan kunci untuk prediksi hasil.

Studi ini menunjukkan bahwa model kecil dapat mencapai kemampuan negosiasi tingkat frontier melalui pelatihan penalaran sosial langsung dan strategi konsolidasi lintas-domain yang efektif.