O relatório apresenta o Zing, um framework integrado projetado para aprimorar a inteligência social de grandes modelos de linguagem ao medir, internalizar e fundamentar capacidades sociais. Os autores apresentam o SoMBench, um benchmark fundamentado na psicologia que abrange 17 dimensões secundárias e 3.481 instâncias verificadas por especialistas, revelando que os LLMs atuais têm uma margem significativa de melhoria, sem nenhum modelo alcançar desempenho próximo ao teto.

  • O Zing emprega uma receita de treinamento orientada por diagnóstico combinando ajuste fino supervisionado, destilação on-policy e aprendizado por reforço baseado em rubricas para internalizar habilidades sociais.
  • O Zing-27B-Stage2 alcança a melhor pontuação média em cinco benchmarks de cognição social, enquanto o Zing-32B-Stage2 permanece competitivo com o DeepSeek-V4-Pro.
  • O Actio é apresentado como uma arquitetura de inferência controlada por um harness que roteia quatro tipos de suporte — PRISM, Starling, SAGE e RAG com gating — para o raciocínio.
  • O harness completo do Actio melhora 14 dos 15 pares modelo-benchmark em cinco modelos base e três benchmarks, demonstrando a eficácia do suporte de tempo de execução tipado.

Esses resultados demonstram que LLMs socialmente inteligentes exigem avanços coordenados em avaliação, internalização paramétrica e fundamentação no momento da implantação para inferir efetivamente estados mentais e adaptar o comportamento.