研究人员推出了VISTA,这是一个视觉框架,旨在解锁通用多模态模型在交互环境中的推理潜力。该系统通过允许模型直接感知周围环境并保持对过去观察的无损视觉记忆,以实现主动检索和重组,从而提供长视域能力。
- 在ARC-AGI-3上,VISTA将Claude Opus 5.0的Relative Human Action Efficiency分数从40.68提升至完美的100.00。
- 该模型完成了所有25场公开游戏,使用的动作比首次参与的人类参与者少57.4%。
- 在涵盖多种视觉游戏和谜题的三个额外基准测试中,它显著优于使用最小框架的基线模型。
VISTA的简单设计允许以最小的适应自然扩展到多样化的视觉环境,突显了其作为推动复杂环境中多模态代理发展的通用工具的潜力。