Los investigadores proponen SpatialClaw, un marco sin entrenamiento que adopta el código como la interfaz de acción para mejorar el razonamiento espacial abierto 3D y 4D en modelos de visión-lenguaje. A diferencia de los agentes existentes que dependen de ejecuciones de un solo paso o llamadas de herramientas rígidas, SpatialClaw mantiene un kernel de Python con estado precargado con marcos de entrada y primitivas de percepción.
- El agente escribe una celda ejecutable por paso condicionada a todas las salidas anteriores, permitiendo una composición flexible de los resultados de la percepción.
- Evaluado en 20 benchmarks de razonamiento espacial, SpatialClaw alcanza una precisión promedio del 59.9%.
- Este rendimiento supera al agente espacial reciente en +11.2 puntos con ganancias consistentes a través de seis VLM backbones de dos familias de modelos.
El enfoque permite que los agentes adapten su análisis a las observaciones de texto y visuales intermedias sin adaptación específica del benchmark o del modelo.