Pesquisadores da NVIDIA introduziram o Spatial-IQ, um framework de diagnóstico projetado para decompor a inteligência espacial de grandes modelos de linguagem multimodais (MLLMs). Diferente dos benchmarks existentes que tratam os modelos como caixas-pretas, esta abordagem decompõe a contagem de objetos em estruturas 3D empilhadas em nove sub-tarefas perceptivas e cognitivas alinhadas com estágios do desenvolvimento humano.
- O framework utiliza o NVIDIA Isaac Sim para gerar proceduralmente um conjunto de dados de aproximadamente 80.000 estruturas 3D empilhadas com ground truth para cada sub-tarefa.
- As avaliações em texto de resposta livre, imagens de múltipla escolha e formatos de edição de imagem revelam que modelos de alto desempenho frequentemente têm sucesso nas tarefas-alvo enquanto falham em sub-tarefas de nível inferior, indicando comportamento por atalho.
- O estudo demonstra que o treinamento com supervisão de chain-of-thought sobre essas sub-tarefas hierárquicas, combinado com aprendizado por reforço com recompensas verificáveis, melhora significativamente tanto a consistência espacial quanto a precisão da tarefa-alvo.
Esta decomposição serve tanto como uma ferramenta de diagnóstico para identificar modos específicos de falha quanto como um sinal de treinamento eficaz para aprimorar a robustez do raciocínio espacial em MLLMs.