연구자들은 컴퓨터 사용 에이전트 궤적에 대한 심판 역할을 하는 비전-언어 모델(VLM)의 신뢰성을 평가하기 위해 설계된 현실적인 벤치마크인 OSReward를 소개합니다. 이 연구는 최신 VLM조차도 체계적인 관용 편향에 시달리며 규모 확장에 너무 비싸다는 점을, 반면 저렴한 오픈 모델은 성능이 낮다는 점을 보여줍니다.

  • OSReward는 플랫폼 간 다단계 인간 주석을 통해 도출된 정답 판정을 갖춘 다양한 에이전트 궤적을 특징으로 합니다.
  • 벤치마크에는 어려운 사례를 위한 OSReward-Hard와 세밀한 효율성 점수를 위한 OSReward-Multi가 포함됩니다.
  • 평가 결과, 현재 VLM 심판은 실패한 실행을 성공으로 잘못 분류하여 신뢰성과 비용 간 격차를 만들어냅니다.
  • 이를 해결하기 위해 저자들은 추론 주석이 달린 궤적 판정의 오픈 코퍼스인 OS-Shepherd-100K를 공개합니다.
  • 이 데이터로 학습된 오픈 OS-Shepherd 모델(9B 및 35B)은 상업용 심판과 유사한 성능을 30-60% 낮은 비용으로 달성합니다.

이 연구는 커뮤니티에 저비용이고 안정적인 보상 신호를 제공하며, 신뢰할 수 있는 컴퓨터 사용 평가 설계를 위한 광범위한 분석을 제시합니다.