Le rapport présente Zing, un framework intégré conçu pour améliorer l'intelligence sociale des grands modèles de langage en mesurant, intériorisant et ancrant les capacités sociales. Les auteurs présentent SoMBench, un benchmark fondé sur la psychologie couvrant 17 dimensions secondaires et 3 481 instances vérifiées par des experts, qui révèle que les LLM actuels ont une marge de progression significative, aucun modèle n'atteignant des performances proches du plafond.

  • Zing utilise une recette d'entraînement basée sur le diagnostic combinant le fine-tuning supervisé, la distillation on-policy et l'apprentissage par renforcement basé sur des grilles pour intérioriser les compétences sociales.
  • Zing-27B-Stage2 obtient le meilleur score moyen sur cinq benchmarks de cognition sociale, tandis que Zing-32B-Stage2 reste compétitif face à DeepSeek-V4-Pro.
  • Actio est présenté comme une architecture d'inférence contrôlée par un harnais qui achemine quatre supports typés — PRISM, Starling, SAGE et RAG à gâchette — vers le raisonnement.
  • Le harnais Actio complet améliore 14 des 15 paires modèle-benchmark sur cinq modèles de base et trois benchmarks, démontrant l'efficacité du support d'exécution typé.

Ces résultats montrent que les LLM socialement intelligents nécessitent des avancées coordonnées dans l'évaluation, l'intériorisation paramétrique et l'ancrage au moment du déploiement pour inférer efficacement les états mentaux et adapter le comportement.