Pesquisadores apresentam o OSReward, um benchmark realista projetado para avaliar a confiabilidade de modelos de visão e linguagem (VLMs) atuando como juízes para trajetórias de agentes que utilizam computadores. O estudo revela que mesmo os VLMs mais avançados sofrem com viés sistemático de indulgência e são frequentemente caros demais para escala, enquanto modelos abertos acessíveis têm desempenho ruim.

  • O OSReward apresenta diversas trajetórias de agentes com vereditos de verdade fundamental derivados de anotação humana em múltiplas etapas entre plataformas.
  • O benchmark inclui o OSReward-Hard para casos desafiadores e o OSReward-Multi para pontuação de eficiência fina.
  • A avaliação mostra que os juízes VLMs atuais rotulam erroneamente execuções falhas como bem-sucedidas, criando uma lacuna entre confiabilidade e custo.
  • Para abordar isso, os autores lançam o OS-Shepherd-100K, um corpus aberto de julgamentos de trajetória com anotações de raciocínio.
  • Treinados nesses dados, os modelos abertos OS-Shepherd (9B e 35B) igualam os juízes comerciais com custo 30-60% menor.

O trabalho fornece sinais de recompensa de baixo custo e estáveis para a comunidade e oferece análises extensas para informar o design de avaliação confiável de uso de computador.