Peneliti memperkenalkan VISTA, sebuah harness visual yang dirancang untuk membuka potensi penalaran model multimodal tujuan umum dalam lingkungan interaktif. Sistem ini menyediakan visi jangka panjang dengan memungkinkan model secara langsung mempersepsikan lingkungan sekitar dan mempertahankan memori visual tanpa kehilangan dari observasi masa lalu untuk pengambilan dan pengorganisasian aktif.

  • Pada ARC-AGI-3, VISTA meningkatkan skor Relative Human Action Efficiency Claude Opus 5.0 dari 40.68 menjadi sempurna 100.00.
  • Model menyelesaikan semua 25 permainan publik menggunakan 57,4% lebih sedikit tindakan daripada peserta manusia yang pertama kali berpartisipasi.
  • Model ini secara substansial mengungguli baseline dengan harness minimal di tiga benchmark tambahan yang mencakup berbagai permainan dan teka-teki visual.

Desain sederhana VISTA memungkinkan ekstensi alami ke berbagai lingkungan visual dengan adaptasi minimal, menyoroti potensinya sebagai alat tujuan umum untuk memajukan agen multimodal dalam pengaturan yang kompleks.