Авторы представляют EviRover, первого агента восприятия, специально обученного разрешать перцептивные запросы через взаимодействие, а не полагаться на однократное предсказание по одному изображению. Чтобы решить проблему недостатка данных для этого сценария, они разработали два выделенных конвейера генерации данных, давших EviRover-SFT-5K и EviRover-RL-12K, а также EviLens — проверенный человеком бенчмарк с 688 примерами.
- Модель EviRover на 4B параметров превосходит свою базовую модель в среднем на 30 пунктов по бенчмарку EviLens.
- Производительность достигает уровней, сопоставимых с передовыми проприетарными моделями.
- Улучшения переносятся на WebEyes, традиционные перцептивные бенчмарки и общие мультимодальные бенчмарки, включая улучшение на 15 пунктов на BrowseComp-VL.
Авторы считают это значимым, поскольку это демонстрирует, что агентное обучение с подкреплением может эффективно справляться с восприятием при недостатке доказательств, где стандартные допущения не работают. Весь код, модели и данные опубликованы.