研究人员提出了 SpatialClaw,这是一个无需训练的框架,采用代码作为动作接口,以改进视觉-语言模型中的开放式 3D 和 4D 空间推理。与依赖单次执行或僵化工具调用的现有智能体不同,SpatialClaw 维护一个有状态的 Python 内核,其中预加载了输入帧和感知基元。

  • 智能体根据所有先前的输出编写每个步骤的一个可执行单元格,允许灵活组合感知结果。
  • 在 20 个空间推理基准测试中评估,SpatialClaw 取得了 59.9% 的平均准确率。
  • 这一性能比最近的智能体高出 +11.2 分,并且在来自两个模型家族的六个 VLM backbones 上均获得了一致的提升。

该方法使智能体能够根据中间文本和视觉观察调整其分析,而无需针对基准或模型进行特定适配。