이 보고서는 Zing를 소개합니다. Zing는 대규모 언어 모델의 사회적 지능을 측정하고, 내재화하며, 기반 추론함으로써 향상시키는 데 설계된 통합 프레임워크입니다. 저자들은 17개의 하위 차원과 3,481명의 전문가가 검증한 인스턴스를 아우르는 심리학 기반 벤치마크인 SoMBench를 제시합니다. 이는 현재 LLM에 상당한 개선의 여지가 있으며 어떤 모델도 거의 최고점 성능에 도달하지 못했음을 보여줍니다.

  • Zing는 지도 미세 조정, 온-폴리시 증류, 기준 기반 강화 학습을 결합한 진단 기반 훈련 레시피를 사용하여 사회적 기술을 내재화합니다.
  • Zing-27B-Stage2는 다섯 가지 사회인지 벤치마크에서 평균 점수 최고치를 달성했으며, Zing-32B-Stage2는 DeepSeek-V4-Pro와 경쟁력 있는 성능을 유지합니다.
  • Actio는 PRISM, Starling, SAGE, 그리고 게이트드 RAG라는 네 가지 유형화된 지원을 추론으로 라우팅하는 하네스 제어형 추론 아키텍처로 소개됩니다.
  • 전체 Actio 하네스는 다섯 가지 기본 모델과 세 가지 벤치마크에 걸쳐 15개 모델-벤치마크 쌍 중 14개를 향상시켜, 유형화된 런타임 지원의 효과성을 입증합니다.

이러한 결과는 사회적으로 지능적인 LLM이 정신 상태를 효과적으로 추론하고 행동을 적응시키기 위해 평가, 매개변수 내재화, 그리고 배포 시점 기반 추론에서 조화된 진전이 필요함을 보여줍니다.