Les chercheurs présentent VISTA, un harnais visuel conçu pour débloquer le potentiel de raisonnement des modèles multimodales polyvalents dans des environnements interactifs. Le système fournit une vision à long terme en permettant aux modèles de percevoir directement l'environnement et de maintenir une mémoire visuelle sans perte des observations passées pour leur récupération et réorganisation actives.

  • Sur ARC-AGI-3, VISTA améliore le score Relative Human Action Efficiency de Claude Opus 5.0 de 40.68 à un parfait 100.00.
  • Le modèle termine tous les 25 jeux publics en utilisant 57,4 % moins d'actions que les participants humains pour la première fois.
  • Il surpasse substantiellement les lignes de base avec des harnais minimaux sur trois benchmarks supplémentaires couvrant divers jeux et puzzles visuels.

La conception simple de VISTA permet une extension naturelle à divers environnements visuels avec une adaptation minimale, mettant en évidence son potentiel en tant qu'outil polyvalent pour faire progresser les agents multimodales dans des environnements complexes.