연구자들은 작은 언어 모델의 전략적 협상자로서의 성능을 향상시키기 위해 사회적 추론을 직접적으로 강화하는 훈련 방법론인 SocialRL을 제시한다. Deal-or-No-Deal과 Job Interview를 포함한 여섯 가지 도메인에 걸쳐 4B 모델에 적용된 이 접근법은 보유된 시나리오에서 GPT-5 계열의 성능을 일치시키거나 초과하는 결과를 가능하게 한다.
- 도메인 내 훈련은 베이스라인에서 프론티어 간격의 73-122%를 해소하며, 78%의 구매자 오프닝이 목표보다 낮은 앵커링을 보이는 반면 훈련되지 않은 모델은 3%에 불과하다.
- 도메인 간 전이는 게임 구조에 의존하며, 구조적으로 짝지어진 게임은 서로 상승시키는 반면 고립된 게임은 전이되지 않는다.
- 캐스케이드 RL과 멀티티처 온-policy 증류는 전문가들을 통합하여 평균 유틸리티 0.627을 달성하는 단일 4B 모델로 통합하며, 이는 GPT-4.1 (0.625)과 GPT-5.2 (0.613)을 초과한다.
- 행동 alone가 아닌 마음의 이론(traces of theory-of-mind)을 증류하면 유틸리티와 일반화가 개선되며, 다음 행동 예측이 결과 예측의 핵심 기술이다.
본 연구는 작은 모델이 직접적인 사회적 추론 훈련과 효과적인 도메인 간 통합 전략을 통해 프론티어 수준의 협상 능력을 달성할 수 있음을 보여준다.