El informe presenta Zing, un marco integrado diseñado para mejorar la inteligencia social de los modelos de lenguaje grandes mediante la medición, internalización y fundamentación de las capacidades sociales. Los autores presentan SoMBench, un benchmark basado en psicología que abarca 17 dimensiones secundarias y 3.481 instancias verificadas por expertos, el cual revela que los LLM actuales tienen un margen significativo de mejora, sin que ningún modelo alcance un rendimiento cercano al máximo.
- Zing emplea una receta de entrenamiento impulsada por diagnóstico que combina ajuste fino supervisado, destilación en línea y aprendizaje por refuerzo basado en rúbricas para internalizar las habilidades sociales.
- Zing-27B-Stage2 logra la mejor puntuación promedio en cinco benchmarks de cognición social, mientras que Zing-32B-Stage2 se mantiene competitivo frente a DeepSeek-V4-Pro.
- Actio se presenta como una arquitectura de inferencia controlada por un arnés que enruta cuatro tipos de soporte —PRISM, Starling, SAGE y RAG con compuerta— hacia el razonamiento.
- El arnés Actio completo mejora 14 de los 15 pares modelo-benchmark en cinco modelos base y tres benchmarks, demostrando la efectividad del soporte de tiempo de ejecución tipado.
Estos resultados demuestran que los LLM socialmente inteligentes requieren avances coordinados en evaluación, internalización paramétrica y fundamentación durante el despliegue para inferir eficazmente estados mentales y adaptar el comportamiento.