Les chercheurs proposent SpatialClaw, un framework sans entraînement qui adopte le code comme interface d'action pour améliorer le raisonnement spatial ouvert 3D et 4D dans les modèles vision-langage. Contrairement aux agents existants qui dépendent d'exécutions en un seul passage ou d'appels d'outils rigides, SpatialClaw maintient un noyau Python avec état préchargé avec des frames d'entrée et des primitives de perception.

  • L'agent écrit une cellule exécutable par étape conditionnée par toutes les sorties précédentes, permettant une composition flexible des résultats de la perception.
  • Évalué sur 20 benchmarks de raisonnement spatial, SpatialClaw atteint une précision moyenne de 59.9%.
  • Cette performance dépasse l'agent spatial récent de +11.2 points avec des gains cohérents à travers six VLM backbones de deux familles de modèles.

L'approche permet aux agents d'adapter leur analyse aux observations textuelles et visuelles intermédiaires sans adaptation spécifique au benchmark ou au modèle.