研究者らは、小さな言語モデルにおける社会的推論を直接強化し、戦略的交渉者としてのパフォーマンスを向上させるトレーニング手法「SocialRL」を発表した。Deal-or-No-DealやJob Interviewなど6つのドメインにわたって4Bモデルに適用したところ、このアプローチにより、未見のシナリオにおいてGPT-5ファミリーのパフォーマンスと同等以上を実現可能となった。

  • ドメイン内トレーニングにより、ベースラインからフロンティア間のギャップの73〜122%を埋め、購入者のオファーが目標値を下回るアンカーリングが78%に達したのに対し、未トレーニングモデルでは3%にとどまった。
  • ドメイン間転移はゲーム構造に依存し、構造的に対応するゲーム同士は互いに性能を向上させるが、孤立したゲーム間では転移しない。
  • カスケードRLとマルチティーチャーのオンポリシー蒸留により、専門家を統合して平均ユーティリティ0.627を達成する統一された4Bモデルを構築し、GPT-4.1 (0.625) や GPT-5.2 (0.613) を上回った。
  • 行動だけでなく理論の痕跡を蒸留することで、ユーティリティと汎化性能が向上し、次アクション予測が結果予測における鍵となるスキルであることが示された。

本研究は、小さなモデルでも直接的な社会的推論トレーニングと効果的なドメイン間統合戦略を通じて、フロンティアレベルの交渉能力を実現できることを実証した。