Les chercheurs présentent SocialRL, une méthode d'entraînement qui renforce directement le raisonnement social dans les petits modèles de langage afin d'améliorer leurs performances en tant que négociateurs stratégiques. Appliquée à un modèle de 4 milliards de paramètres sur six domaines incluant Deal-or-No-Deal et l'entretien d'embauche, cette approche permet au modèle d'égaler ou de dépasser les performances de la famille GPT-5 sur des scénarios non vus.

  • L'entraînement intra-domaine comble 73 à 122 % de l'écart entre la ligne de base et le niveau前沿 (frontier), avec 78 % des ouvertures des acheteurs ancrées en dessous de l'objectif contre 3 % pour les modèles non entraînés.
  • Le transfert inter-domaine dépend de la structure du jeu : les jeux structurellement appariés s'améliorent mutuellement tandis que les jeux isolés ne transfèrent pas.
  • Le RL en cascade et la distillation on-policy multi-professeurs consolident des spécialistes en un modèle unifié de 4 milliards de paramètres atteignant une utilité moyenne de 0,627, surpassant GPT-4.1 (0,625) et GPT-5.2 (0,613).
  • La distillation des traces de théorie de l'esprit plutôt que des actions seules améliore l'utilité et la généralisation, la prédiction de l'action suivante étant la compétence clé pour la prédiction du résultat.

L'étude démontre que les petits modèles peuvent atteindre des capacités de négociation de niveau前沿 grâce à un entraînement direct au raisonnement social et à des stratégies efficaces de consolidation inter-domaine.