연구자들은 상호작용 환경에서 범용 멀티모달 모델의 추론 잠재력을 해제하도록 설계된 시각적 하니스인 VISTA를 소개합니다. 이 시스템은 모델이 주변을 직접 지각하고 능동적 검색 및 재구성을 위해 과거 관찰의 무손실 시각적 메모리를 유지할 수 있도록 함으로써 장기 비전을 제공합니다.
- ARC-AGI-3에서 VISTA는 Claude Opus 5.0의 Relative Human Action Efficiency 점수를 40.68에서 완벽한 100.00으로 향상시킵니다.
- 모델은 첫 번째로 참여하는 인간 참가자보다 57.4% 적은 동작을 사용하여 모든 25개의 공개 게임을 완료합니다.
- 다양한 시각적 게임과 퍼즐을 아우르는 세 가지 추가 벤치마크에서 최소한의 하니스를 사용한 베이스라인을 크게 능가합니다.
VISTA의 간단한 설계는 최소한의 적응으로 다양한 시각적 환경에 자연스럽게 확장할 수 있게 하여, 복잡한 설정에서 멀티모달 에이전트를 발전시키기 위한 범용 도구로서의 잠재력을 강조합니다.