Pesquisadores apresentam o SocialRL, uma receita de treinamento que reforça diretamente o raciocínio social em modelos de linguagem pequenos para melhorar seu desempenho como negociadores estratégicos. Aplicado a um modelo de 4B em seis domínios, incluindo Deal-or-No-Deal e Entrevista de Emprego, a abordagem permite que o modelo iguale ou supere o desempenho da família GPT-5 em cenários não vistos.

  • O treinamento in-domain fecha 73-122% da lacuna entre a linha de base e a fronteira, com 78% das aberturas do comprador ancoradas abaixo do alvo, contra 3% para modelos não treinados.
  • A transferência cross-domain depende da estrutura do jogo, onde jogos estruturalmente pareados se elevam mutuamente, enquanto jogos isolados não transferem.
  • O Cascade RL e a distilação on-policy de multi-professores consolidam especialistas em um modelo unificado de 4B que alcança utilidade média de 0.627, superando GPT-4.1 (0.625) e GPT-5.2 (0.613).
  • Destilar traços de teoria da mente, em vez de apenas ações, melhora a utilidade e a generalização, sendo a previsão da próxima ação a habilidade-chave para a previsão de resultados.

O estudo demonstra que modelos pequenos podem alcançar capacidades de negociação de nível fronteira por meio de treinamento direto de raciocínio social e estratégias eficazes de consolidação cross-domain.