연구자들은 SpatialClaw를 제안했습니다. 이는 훈련 없는 프레임워크로, 비전-언어 모델에서 오픈 엔디드 3D 및 4D 공간 추론을 개선하기 위해 액션 인터페이스로 코드를 채택합니다. 기존 에이전트들이 단일 패스 실행이나 경직된 도구 호출에 의존하는 것과 달리, SpatialClaw는 입력 프레임과 지각 프리미티브가 사전 로드된 상태 유지 Python 커널을 유지합니다.

  • 에이전트는 모든 이전 출력에 조건부인 단계당 하나의 실행 가능한 셀을 작성하여 지각 결과의 유연한 조합을 허용합니다.
  • 20개 공간 추론 벤치마크에서 평가된 SpatialClaw는 평균 정확도 59.9%를 달성했습니다.
  • 이 성능은 최근 공간 에이전트보다 +11.2 포인트 더 뛰어나며, 두 모델 패밀리에서 온 6개의 VLM backbones 전반에 걸쳐 일관된 향상을 보입니다.

이 접근 방식은 벤치마크 또는 모델 특정 적응 없이 중간 텍스트 및 시각적 관찰에 맞춰 분석을 적응할 수 있게 합니다.