本レポートでは、大規模言語モデルの社会的知能を測定し、内部化し、グラウンディングすることで強化することを目的とした統合フレームワークであるZingを紹介しています。著者らは、17の二次次元と3,481件の専門家検証済みインスタンスにわたる心理学基盤のベンチマークであるSoMBenchを発表しました。これにより、現在のLLMには大幅な改善の余地があり、どのモデルもほぼ天井性能に達していないことが明らかになりました。
- Zingは、教師ありファインチューニング、オンポリシー蒸留、およびルーブリックベース強化学習を組み合わせた診断駆動型トレーニングレシピを用いて、社会的スキルを内部化します。
- Zing-27B-Stage2は5つの社会認知ベンチマークで平均スコア最高を達成し、Zing-32B-Stage2はDeepSeek-V4-Proと競合する性能を示しています。
- Actioは、PRISM、Starling、SAGE、およびgated RAGという4つの型付きサポートを推論にルーティングするハーネス制御型推論アーキテクチャとして導入されました。
- 完全なActioハーネスは、5つのベースモデルと3つのベンチマークにわたる15組のモデル-ベンチマークペアのうち14組で改善をもたらし、型付きランタイムサポートの有効性を示しました。
これらの結果は、社会的知能を持つLLMが、メンタルステートの推論や行動適応を効果的に行うために、評価、パラメトリック内部化、およびデプロイメント時のグラウンディングにおける協調的な進展を必要とすることを示しています。