Los investigadores presentan VISTA, un arnés visual diseñado para desbloquear el potencial de razonamiento de los modelos multimodales de propósito general en entornos interactivos. El sistema proporciona visión de largo alcance permitiendo a los modelos percibir directamente el entorno y mantener una memoria visual sin pérdidas de observaciones pasadas para su recuperación y reorganización activas.
- En ARC-AGI-3, VISTA mejora la puntuación Relative Human Action Efficiency de Claude Opus 5.0 de 40.68 a un perfecto 100.00.
- El modelo completa los 25 juegos públicos utilizando un 57.4% menos de acciones que los participantes humanos por primera vez.
- Supera sustancialmente a las líneas base con arneses mínimos en tres benchmarks adicionales que cubren diversos juegos y rompecabezas visuales.
El diseño simple de VISTA permite una extensión natural a diversos entornos visuales con mínima adaptación, destacando su potencial como herramienta de propósito general para avanzar agentes multimodales en entornos complejos.