Los investigadores presentan OSReward, un benchmark realista diseñado para evaluar la fiabilidad de los modelos de visión y lenguaje (VLM) que actúan como jueces para trayectorias de agentes que utilizan computadoras. El estudio revela que incluso los VLM más avanzados adolecen de un sesgo sistemático de indulgencia y suelen ser demasiado costosos para su escalado, mientras que los modelos abiertos asequibles tienen un rendimiento deficiente.
- OSReward cuenta con diversas trayectorias de agentes con veredictos de referencia derivados de la anotación humana en múltiples etapas a través de plataformas.
- El benchmark incluye OSReward-Hard para casos desafiantes y OSReward-Multi para una puntuación de eficiencia detallada.
- La evaluación muestra que los jueces VLM actuales etiquetan erróneamente las ejecuciones fallidas como exitosas, creando una brecha entre la fiabilidad y el costo.
- Para abordar esto, los autores publican OS-Shepherd-100K, un corpus abierto de juicios de trayectorias anotados con razonamiento.
- Entrenados con estos datos, los modelos abiertos OS-Shepherd (9B y 35B) igualan a los jueces comerciales con un costo del 30-60% menor.
El trabajo proporciona señales de recompensa estables y de bajo costo para la comunidad y ofrece análisis extensos para informar el diseño de evaluaciones fiables de uso de computadora.