著者は、単一の画像からのワンショット予測に依存するのではなく、相互作用を通じて知覚クエリを解決するように明示的にトレーニングされた最初の知覚エージェントであるEviRoverを紹介します。この設定のためのデータの不足に対処するため、彼らはEviRover-SFT-5KとEviRover-RL-12Kを生み出す2つの専用データ生成パイプラインと、688のインスタンスを持つ人間検証済みベンチマークであるEviLensを設計しました。

  • 4BのEviRoverモデルは、EviLensベンチマークでバックボーンよりも平均して30ポイント優れています。
  • パフォーマンスは先進的なプロプライエタリモデルと同等のレベルに達します。
  • 改善点はWebEyes、従来の知覚ベンチマーク、BrowseComp-VLでの15ポイントの改善を含む一般的なマルチモーダルベンチマークにも移行します。

著者はこれを重要と考えています。これは、標準的な仮定が失敗する不十分な証拠の下で、エージェント型強化学習が知覚を効果的に処理できることを示しているからです。すべてのコード、モデル、およびデータが公開されています。