研究者らは、インタラクティブ環境における汎用マルチモーダルモデルの推論能力を引き出すために設計されたビジュアルハーネスであるVISTAを紹介します。このシステムは、モデルが周囲を直接知覚し、アクティブな取得と再編成のために過去の観測のロスレスな視覚メモリを維持することを可能にすることで、長期ビジョンを提供します。

  • ARC-AGI-3において、VISTAはClaude Opus 5.0のRelative Human Action Efficiencyスコアを40.68から完璧な100.00に改善します。
  • モデルは25の公開ゲームすべてを完了し、初めて参加した人間の参加者よりも57.4%少ないアクションで完了します。
  • 多様な視覚ゲームとパズルをカバーする3つの追加ベンチマークにおいて、最小限のハーネスを持つベースラインを大幅に上回ります。

VISTAのシンプルな設計は、最小限の適応で多様な視覚環境への自然な拡張を可能にし、複雑な設定におけるマルチモーダルエージェントの進展のための汎用ツールとしてのその可能性を強調しています。