Исследователи предлагают SpatialClaw, фреймворк без обучения, который использует код в качестве интерфейса действий для улучшения открытого пространственного рассуждения 3D и 4D в моделях «зрение-язык». В отличие от существующих агентов, полагающихся на однократное выполнение или жесткие вызовы инструментов, SpatialClaw поддерживает состоящее ядро Python, предварительно загруженное входными кадрами и примитивами восприятия.

  • Агент записывает одну исполняемую ячейку на шаг, обусловленную всеми предыдущими выводами, что позволяет гибко комбинировать результаты восприятия.
  • Оценка по 20 бенчмаркам пространственного рассуждения показала, что SpatialClaw достигает средней точности 59.9%.
  • Эта производительность превосходит недавнего агента для работы с пространством на +11.2 балла с последовательными улучшениями across шести VLM backbones из двух семейств моделей.

Подход позволяет агентам адаптировать свой анализ к промежуточным текстовым и визуальным наблюдениям без адаптации, специфичной для бенчмарка или модели.