研究人员推出了 OSReward,这是一个旨在评估视觉语言模型(VLMs)作为计算机使用智能体轨迹裁判可靠性的真实基准。研究表明,即使是最先进的 VLMs 也存在系统性的宽容偏差,且成本高昂难以规模化,而廉价的开源模型表现不佳。
- OSReward 包含多样化的智能体轨迹,其真实判决源自跨平台的多阶段人工标注。
- 该基准包括用于挑战性案例的 OSReward-Hard 和用于细粒度效率评分的 OSReward-Multi。
- 评估显示,当前的 VLM 裁判将失败的运行错误标记为成功,导致可靠性与成本之间存在差距。
- 为解决这一问题,作者发布了 OS-Shepherd-100K,这是一个包含推理标注轨迹判决的开源语料库。
- 在该数据上训练的开源 OS-Shepherd 模型(9B 和 35B)以低 30-60% 的成本达到了与商业裁判相当的水平。
这项工作为社区提供了低成本、稳定的奖励信号,并提供了广泛的分析以指导可靠的计算机使用评估的设计。