研究者らは、SpatialClawを提案しました。これはトレーニング不要のフレームワークで、ビジョン・ランゲージモデルにおけるオープンエンドな3Dおよび4D空間推論を改善するために、アクションインターフェースとしてコードを採用しています。既存のエージェントが単一パス実行や硬直したツール呼び出しに依存するのとは異なり、SpatialClawは入力フレームと知覚プリミティブが事前に読み込まれたステートフルなPythonカーネルを維持します。
- エージェントは、すべての以前の出力に基づいてステップごとに1つの実行可能セルを書き込み、知覚結果の柔軟な組み合わせを可能にします。
- 20の空間推論ベンチマークで評価され、SpatialClawは平均精度59.9%を達成しました。
- このパフォーマンスは、最近の空間エージェントを+11.2ポイント上回り、2つのモデルファミリーからの6つのVLM backbonesで一貫した向上を示しています。
このアプローチにより、エージェントはベンチマークやモデル固有の適応なしに、中間テキストおよび視覚的観察に応じて分析を適応させることができます。