Исследователи представляют OSReward, реалистичный бенчмарк, предназначенный для оценки надежности моделей «визуальный язык» (VLM), выступающих в роли судей для траекторий агентов, использующих компьютер. Исследование показывает, что даже самые современные VLM страдают от систематической предвзятости к снисходительности и часто слишком дороги для масштабирования, тогда как доступные открытые модели работают плохо.

  • OSReward включает разнообразные траектории агентов с эталонными вердиктами, полученными в результате многоступенчатой аннотации людьми на разных платформах.
  • Бенчмарк включает OSReward-Hard для сложных случаев и OSReward-Multi для детальной оценки эффективности.
  • Оценка показывает, что текущие VLM-судьи ошибочно классифицируют неудачные запуски как успешные, создавая разрыв между надежностью и стоимостью.
  • Чтобы решить эту проблему, авторы выпускают OS-Shepherd-100K, открытый корпус траекторий с аннотированными рассуждениями.
  • Обученные на этих данных открытые модели OS-Shepherd (9B и 35B) соответствуют коммерческим судьям при стоимости на 30-60% ниже.

Работа предоставляет сообществу дешевые и стабильные сигналы вознаграждения и предлагает обширные анализы для информирования дизайна надежной оценки использования компьютера.