Benchmark · agentic
BrowseComp
BrowseComp 是 OpenAI 推出的面向 AI 网页浏览智能体的基准,用于检验它们能否在互联网上追踪那些难以查找、分散各处的事实。结果以正确回答问题的百分比来衡量。
了解更多
- 示例
- 一个典型题目会提出一个问题,其简短的事实性答案(一个名字、日期或数字)深藏于网络之中,需要在众多页面上进行坚持不懈的多步搜索才能找到。
- 评分方式
- 指标是准确率(accuracy):智能体的答案与唯一已知正确答案相符的题目所占的百分比。
- 验证方式
- 只有当答案与预先设定的标准答案相符时才算通过(按精确匹配方式判定);题目的设计使答案难以查找,但一旦给出便容易核验。
- 为何重要
- 它考察的是普通聊天机器人不具备的能力——多步骤、坚持不懈的深度网络检索,因此即便对强大的模型来说,它仍是一项对智能体浏览能力的严苛考验。
示例解析
任务
BrowseComp 题目:「说出一部在 2010 至 2015 年间上映的故事片,它 (1) 获得了奥斯卡最佳影片奖,(2) 以一次秘密营救行动为剧情,(3) 由饰演主角的同一人执导,且 (4) 高潮发生在德黑兰的机场。只需给出影片名称。」
解答
各条约束交汇于同一部影片——一部 2010–2015 年间的奥斯卡最佳影片得主,是一部由主演本人执导、以德黑兰机场为高潮的秘密营救题材剧情片。最终答案:Argo (2012),由 Ben Affleck 执导并主演。
解析
每条线索都在缩小候选范围——2010–2015 年奥斯卡最佳影片得主,再筛出由主演本人执导的营救题材影片,最后是高潮发生在德黑兰机场的那一部——只剩下 Argo,正是 Ben Affleck 自导自演。BrowseComp 通过精确匹配或模型判定,将简短的自由文本答案与参考答案比对,因此「Argo」判为正确。