लेखकों ने EviRover का परिचय दिया, जो पहला दृश्यिक अनुभव एजेंट है जिसे स्पष्ट रूप से एक बार की भविष्यवाणी पर निर्भर करने के बजाय इंटरैक्शन के माध्यम से दृश्यिक प्रश्नों को हल करने के लिए प्रशिक्षित किया गया है। इस सेटिंग के लिए डेटा की कमी को दूर करने के लिए, उन्होंने दो समर्पित डेटा जनरेशन पाइपलाइन डिज़ाइन किए जो EviRover-SFT-5K और EviRover-RL-12K देते हैं, साथ ही EviLens, एक मानव-सत्यापित बेंचमार्क जिसमें 688 उदाहरण हैं।

  • 4B EviRover मॉडल EviLens बेंचमार्क पर औसतन अपने बैकबोन से 30 अंक बेहतर है।
  • प्रदर्शन उन्नत स्वामित्व वाले मॉडलों के तुलनीय स्तर तक पहुँचता है।
  • लाभ WebEyes, पारंपरिक दृश्यिक बेंचमार्क और सामान्य बहुआयामी बेंचमार्क में स्थानांतरित हो जाते हैं, जिसमें BrowseComp-VL पर 15 अंक की सुधार शामिल है।

लेखकों का मानना है कि यह महत्वपूर्ण है क्योंकि यह दिखाता है कि एजेंटिक पुनर्बल सीखना तब प्रभावी ढंग से दृश्यिक अनुभव को संभाल सकता है जब मानक धारणाएँ विफल हो जाती हैं। सभी कोड, मॉडल और डेटा जारी किए गए हैं।