该报告介绍了Zing,一个旨在通过测量、内化和接地社会能力来增强大型语言模型社会智能的综合框架。作者提出了SoMBench,这是一个基于心理学的基准测试,涵盖17个二级维度和3,481个经专家验证的实例,结果显示当前大语言模型仍有显著的提升空间,没有任何模型达到接近天花板的表现。

  • Zing采用诊断驱动的配方,结合监督微调、在线策略蒸馏和基于量化的强化学习来内化社交技能。
  • Zing-27B-Stage2在五个社会认知基准测试中取得了最佳平均得分,而Zing-32B-Stage2与DeepSeek-V4-Pro保持竞争力。
  • Actio被引入为一种由harness控制的推理架构,将四种类型的支持——PRISM、Starling、SAGE和门控RAG——路由到推理过程中。
  • 完整的Actio harness在五个基础模型和三个基准测试的15个模型-基准对中的14个上实现了提升,证明了类型化运行时支持的有效性。

这些结果表明,具有社会智能的大语言模型需要在评估、参数内化和部署时接地方面取得协调进步,以有效推断心理状态并适应行为。