Pesquisadores propõem o SpatialClaw, um framework sem treinamento que adota o código como a interface de ação para melhorar o raciocínio espacial aberto 3D e 4D em modelos de visão-linguagem. Diferente dos agentes existentes que dependem de execução de passagem única ou chamadas de ferramentas rígidas, o SpatialClaw mantém um kernel Python com estado pré-carregado com quadros de entrada e primitivas de percepção.
- O agente escreve uma célula executável por passo condicionada a todas as saídas anteriores, permitindo composição flexível dos resultados da percepção.
- Avaliado em 20 benchmarks de raciocínio espacial, o SpatialClaw alcança precisão média de 59.9%.
- Este desempenho supera o agente espacial recente em +11.2 pontos com ganhos consistentes através de seis VLM backbones de duas famílias de modelos.
A abordagem permite que os agentes adaptem sua análise às observações intermediárias de texto e visuais sem adaptação específica do benchmark ou do modelo.