Pesquisadores apresentam o VISTA, uma estrutura visual projetada para desbloquear o potencial de raciocínio de modelos multimodais de propósito geral em ambientes interativos. O sistema fornece visão de longo alcance permitindo que os modelos percebam diretamente o entorno e mantenham uma memória visual sem perdas de observações passadas para recuperação e reorganização ativas.

  • No ARC-AGI-3, o VISTA melhora a pontuação Relative Human Action Efficiency do Claude Opus 5.0 de 40.68 para um perfeito 100.00.
  • O modelo completa todos os 25 jogos públicos usando 57,4% menos ações do que participantes humanos pela primeira vez.
  • Ele supera substancialmente as linhas de base com estruturas mínimas em três benchmarks adicionais cobrindo diversos jogos e quebra-cabeças visuais.

O design simples do VISTA permite uma extensão natural para diversos ambientes visuais com mínima adaptação, destacando seu potencial como uma ferramenta de propósito geral para avançar agentes multimodais em configurações complexas.