Исследователи представляют SocialRL, рецепт обучения, который напрямую усиливает социальное рассуждение в малых языковых моделях для улучшения их производительности как стратегических переговорщиков. Примененный к модели на 4B параметрам в шести доменах, включая Deal-or-No-Deal и Job Interview, подход позволяет модели соответствовать или превосходить производительность семейства GPT-5 на отложенных сценариях.
- Обучение внутри домена закрывает 73-122% разрыва между базовой и передовой границей, при этом 78% начальных позиций покупателя фиксируются ниже целевого уровня по сравнению с 3% для необученных моделей.
- Перенос между доменами зависит от структуры игры: структурно связанные игры повышают друг друга, тогда как изолированные игры не передаются.
- Каскадное RL и многоучительское on-policy дистилляция объединяют специалистов в единую модель на 4B параметрам, достигающую средней полезности 0.627, превосходя GPT-4.1 (0.625) и GPT-5.2 (0.613).
- Дистилляция следов теории разума вместо одних действий улучшает полезность и обобщение, где предсказание следующего действия является ключевым навыком для предсказания результата.
Исследование демонстрирует, что малые модели могут достигать передовых переговорных способностей через прямое обучение социальному рассуждению и эффективные стратегии консолидации между доменами.