Исследователи представляют VISTA, визуальный каркас, предназначенный для раскрытия потенциала рассуждений обобщенных мультимодальных моделей в интерактивных средах. Система обеспечивает зрение на длинном горизонте, позволяя моделям напрямую воспринимать окружение и сохранять без потерь визуальную память о прошлых наблюдениях для активного извлечения и реорганизации.
- На ARC-AGI-3 VISTA улучшает показатель Relative Human Action Efficiency модели Claude Opus 5.0 с 40.68 до идеальных 100.00.
- Модель завершает все 25 публичных игр, используя на 57.4% меньше действий, чем участники-люди впервые.
- Она существенно превосходит базовые варианты с минимальными каркасами в трех дополнительных бенчмарках, охватывающих разнообразные визуальные игры и головоломки.
Простой дизайн VISTA позволяет естественным образом расширять его на разнообразные визуальные среды при минимальной адаптации, подчеркивая его потенциал как инструмента общего назначения для продвижения мультимодальных агентов в сложных условиях.