Investigadores de NVIDIA han presentado Spatial-IQ, un marco de diagnóstico diseñado para descomponer la inteligencia espacial de los grandes modelos de lenguaje multimodales (MLLMs). A diferencia de las evaluaciones existentes que tratan a los modelos como cajas negras, este enfoque descompone el conteo de objetos en estructuras 3D apiladas en nueve sub-tareas perceptivas y cognitivas alineadas con las etapas del desarrollo humano.

  • El marco utiliza NVIDIA Isaac Sim para generar proceduralmente un conjunto de datos de aproximadamente 80.000 estructuras 3D apiladas con la verdad fundamental para cada sub-tarea.
  • Las evaluaciones en texto de respuesta libre, imágenes de opción múltiple y formatos de edición de imagen revelan que los modelos de mejor rendimiento a menudo tienen éxito en las tareas objetivo mientras fallan en sub-tareas de nivel inferior, lo que indica un comportamiento de atajo.
  • El estudio demuestra que entrenar con supervisión de cadena de pensamiento sobre estas sub-tareas jerárquicas, combinado con aprendizaje por refuerzo con recompensas verificables, mejora significativamente tanto la consistencia espacial como la precisión en la tarea objetivo.

Esta descomposición sirve tanto como una herramienta de diagnóstico para identificar modos específicos de fallo como una señal de entrenamiento efectiva para mejorar la robustez del razonamiento espacial en MLLMs.