Les chercheurs de NVIDIA ont présenté Spatial-IQ, un cadre de diagnostic conçu pour décomposer l'intelligence spatiale des grands modèles de langage multimodaux (MLLM). Contrairement aux benchmarks existants qui traitent les modèles comme des boîtes noires, cette approche décompose le comptage d'objets dans des structures 3D empilées en neuf sous-tâches perceptives et cognitives alignées sur les étapes du développement humain.
- Le cadre utilise NVIDIA Isaac Sim pour générer de manière procédurale un jeu de données d'environ 80 000 structures 3D empilées avec une vérité terrain pour chaque sous-tâche.
- Les évaluations à travers les formats de texte en réponse libre, d'images à choix multiples et d'édition d'images révèlent que les modèles performants réussissent souvent la tâche cible tout en échouant des sous-tâches de niveau inférieur, indiquant un comportement de raccourci.
- L'étude démontre que l'entraînement avec une supervision par chaîne de pensée sur ces sous-tâches hiérarchiques, combinée à l'apprentissage par renforcement avec récompenses vérifiables, améliore significativement à la fois la cohérence spatiale et la précision de la tâche cible.
Cette décomposition sert à la fois d'outil de diagnostic pour identifier des modes d'échec spécifiques et de signal d'entraînement efficace pour renforcer la robustesse du raisonnement spatial dans les MLLM.