研究人员提出了 SocialRL,这是一种直接在小型语言模型中强化社会推理的训练方案,以提升其作为战略谈判者的表现。该方法应用于一个 4B 模型,涵盖《Deal-or-No-Deal》和求职面试等六个领域,使模型在未见过的情景中达到或超越 GPT-5 系列的性能。
- 域内训练缩小了基线到前沿差距的 73-122%,其中 78% 的买方开价锚定在目标之下,而未训练模型的这一比例为 3%。
- 跨领域迁移取决于游戏结构,结构上配对的游戏相互提升,而孤立的游戏无法迁移。
- 级联强化学习和多教师在线策略蒸馏将专家整合为一个统一的 4B 模型,实现 0.627 的平均效用,超越 GPT-4.1 (0.625) 和 GPT-5.2 (0.613)。
- 蒸馏心智理论轨迹而非仅动作,提升了效用和泛化能力,其中下一步动作预测是结果预测的关键技能。
该研究表明,小型模型可以通过直接的社会推理训练和有效的跨领域整合策略实现前沿水平的谈判能力。