Los investigadores presentan SocialRL, una receta de entrenamiento que refuerza directamente el razonamiento social en modelos de lenguaje pequeños para mejorar su rendimiento como negociadores estratégicos. Aplicado a un modelo de 4B en seis dominios, incluyendo Deal-or-No-Deal y Entrevista de trabajo, el enfoque permite al modelo igualar o superar el rendimiento de la familia GPT-5 en escenarios no vistos.
- El entrenamiento in-domain cierra del 73% al 122% de la brecha entre la línea base y la frontera, con el 78% de las aperturas del comprador ancladas por debajo del objetivo frente al 3% para los modelos no entrenados.
- La transferencia cross-domain depende de la estructura del juego, donde los juegos estructuralmente emparejados se potencian mutuamente mientras que los juegos aislados no transfieren.
- El Cascade RL y la destilación on-policy multi-teacher consolidan especialistas en un modelo unificado de 4B que alcanza una utilidad promedio de 0.627, superando a GPT-4.1 (0.625) y GPT-5.2 (0.613).
- Destilar trazas de teoría de la mente en lugar de solo acciones mejora la utilidad y la generalización, siendo la predicción de la siguiente acción la habilidad clave para la predicción del resultado.
El estudio demuestra que los modelos pequeños pueden lograr capacidades de negociación de nivel frontera mediante entrenamiento directo de razonamiento social y estrategias efectivas de consolidación cross-domain.