Les chercheurs présentent OSReward, un benchmark réaliste conçu pour évaluer la fiabilité des modèles vision-langage (VLM) agissant comme juges pour les trajectoires d'agents utilisant un ordinateur. L'étude révèle que même les VLM les plus avancés souffrent d'un biais de clémence systématique et sont souvent trop coûteux à l'échelle, tandis que les modèles ouverts abordables performe mal.
- OSReward propose des trajectoires d'agents diversifiées avec des verdicts de référence issus d'une annotation humaine multi-étapes sur plusieurs plateformes.
- Le benchmark inclut OSReward-Hard pour les cas difficiles et OSReward-Multi pour une notation fine de l'efficacité.
- L'évaluation montre que les juges VLM actuels étiquettent incorrectement les échecs comme des succès, créant un écart entre fiabilité et coût.
- Pour remédier à cela, les auteurs publient OS-Shepherd-100K, un corpus ouvert de jugements de trajectoires annotés avec du raisonnement.
- Entraînés sur ces données, les modèles ouverts OS-Shepherd (9B et 35B) égalent les juges commerciaux avec un coût réduit de 30 à 60 %.
Ce travail fournit des signaux de récompense stables et peu coûteux à la communauté et propose des analyses approfondies pour éclairer la conception d'évaluations fiables de l'utilisation d'ordinateur.