Benchmark · agentic

BrowseComp

26 条结果 23 个模型

BrowseComp 是 OpenAI 推出的面向 AI 网页浏览智能体的基准,用于检验它们能否在互联网上追踪那些难以查找、分散各处的事实。结果以正确回答问题的百分比来衡量。

了解更多
示例
一个典型题目会提出一个问题,其简短的事实性答案(一个名字、日期或数字)深藏于网络之中,需要在众多页面上进行坚持不懈的多步搜索才能找到。
评分方式
指标是准确率(accuracy):智能体的答案与唯一已知正确答案相符的题目所占的百分比。
验证方式
只有当答案与预先设定的标准答案相符时才算通过(按精确匹配方式判定);题目的设计使答案难以查找,但一旦给出便容易核验。
为何重要
它考察的是普通聊天机器人不具备的能力——多步骤、坚持不懈的深度网络检索,因此即便对强大的模型来说,它仍是一项对智能体浏览能力的严苛考验。
示例解析
任务
BrowseComp 题目:「说出一部在 2010 至 2015 年间上映的故事片,它 (1) 获得了奥斯卡最佳影片奖,(2) 以一次秘密营救行动为剧情,(3) 由饰演主角的同一人执导,且 (4) 高潮发生在德黑兰的机场。只需给出影片名称。」
解答
各条约束交汇于同一部影片——一部 2010–2015 年间的奥斯卡最佳影片得主,是一部由主演本人执导、以德黑兰机场为高潮的秘密营救题材剧情片。最终答案:Argo (2012),由 Ben Affleck 执导并主演。
解析
每条线索都在缩小候选范围——2010–2015 年奥斯卡最佳影片得主,再筛出由主演本人执导的营救题材影片,最后是高潮发生在德黑兰机场的那一部——只剩下 Argo,正是 Ben Affleck 自导自演。BrowseComp 通过精确匹配或模型判定,将简短的自由文本答案与参考答案比对,因此「Argo」判为正确。
0 24.5 49 73.5 98 2025-04-10 2025-12-11 2026-08-13 GLM-4.5 · 26.4 · 2025-08-06 Tongyi DeepResearch · 43.4 · 2025-09-16 Kimi K2 Thinking · 60.2 · 2025-11-07 MiroThinker v1.0 (72B variant) · 47.1 · 2025-11-14 Kimi K2.5 · 74.9 · 2026-01-27 Claude Opus 4.6 · 84 · 2026-02-05 Claude Opus 4.6 · 83.7 · 2026-02-05 Claude Opus 4.6 · 83.7 · 2026-03-06 Step 3.5 Flash · 69 · 2026-02-10 Qwen3.5-397B-A17B · 78.6 · 2026-02-16 Opus 4.6 · 84 · 2026-04-21 GPT-5.4 · 82.7 · 2026-04-21 GPT-5.4 Pro · 89.3 · 2026-04-21 Gemini 3.1 Pro · 85.9 · 2026-04-23 GPT-5.5 · 84.4 · 2026-04-23 Agents-A1 · 75.5 · 2026-07-06 GPT-5.6 Sol · 92.2 · 2026-07-09 Mach-Mind-4-Flash · 72.3 · 2026-07-13 Mach-Mind-4-Flash · 72.3 · 2026-07-13 Qwen3-4B · 35.6 · 2026-07-16 Qwen3-30B-A3B · 42.6 · 2026-07-16 GPT-Live-1 · 75.2 · 2026-07-17 Kimi K3 · 91.2 · 2026-07-17 GPT-5.6 Luna (Extra High) · 84.0 · 2026-08-13 GPT-5.5 (Extra High) · 84.4 · 2026-08-13 OpenAI Deep Research · 51.5 · 2025-04-10
GLM-4.5 Tongyi DeepResearch Kimi K2 Thinking MiroThinker v1.0 (72B variant) Kimi K2.5 Claude Opus 4.6 Step 3.5 Flash Qwen3.5-397B-A17B Opus 4.6 GPT-5.4 GPT-5.4 Pro Gemini 3.1 Pro GPT-5.5 Agents-A1 GPT-5.6 Sol Mach-Mind-4-Flash Qwen3-4B Qwen3-30B-A3B GPT-Live-1 Kimi K3 GPT-5.6 Luna (Extra High) GPT-5.5 (Extra High) OpenAI Deep Research
时间线
日期 模型 得分 来源
2026-08-13 GPT-5.6 Luna (Extra High) 84.04% OpenAI发布GPT-5.6,以可负担的成本提供高性能智能体工作流
2026-08-13 GPT-5.5 (Extra High) 84.36% OpenAI发布GPT-5.6,以可负担的成本提供高性能智能体工作流
2026-07-17 Kimi K3 91.2% 月之暗面发布开源 Kimi K3,拥有 2.8T 参数和 100 万上下文的 MoE 模型
2026-07-17 GPT-Live-1 75.2% OpenAI 发布全双工语音模型,德国法院判定谷歌对 AI 概览内容承担责任
2026-07-16 Qwen3-4B 35.6% TRACE通过回合级信用估计改善长视野智能体的工具使用
2026-07-16 Qwen3-30B-A3B 42.6% TRACE通过回合级信用估计改善长视野智能体的工具使用
2026-07-13 Mach-Mind-4-Flash 72.31% Mach-Mind-4-Flash:35B MoE 智能体模型通过训练后优化媲美更大规模模型
2026-07-13 Mach-Mind-4-Flash 72.31% Mach-Mind-4-Flash:35B MoE 智能体模型通过训练后优化媲美更大规模模型
2026-07-09 GPT-5.6 Sol 92.2% OpenAI 发布 GPT-5.6 系列,包含 Sol、Terra 和 Luna 模型
2026-07-06 Agents-A1 75.5pts 扩展视界而非参数量:以35B智能体实现万亿参数级性能
2026-04-23 Gemini 3.1 Pro 85.9% OpenAI发布具备智能体能力的GPT-5.5,API定价翻倍
2026-04-23 GPT-5.5 84.4% OpenAI发布具备智能体能力的GPT-5.5,API定价翻倍
2026-04-21 Opus 4.6 84.0% Google 推出基于 Gemini 3.1 Pro 的 Deep Research 和 Deep Research Max 智能体
2026-04-21 GPT-5.4 82.7% Google 推出基于 Gemini 3.1 Pro 的 Deep Research 和 Deep Research Max 智能体
2026-04-21 GPT-5.4 Pro 89.3% Google 推出基于 Gemini 3.1 Pro 的 Deep Research 和 Deep Research Max 智能体
2026-03-06 Claude Opus 4.6 83.73% Anthropic发布Claude Opus 4.6系统卡,详述能力与安全评估
2026-02-16 Qwen3.5-397B-A17B 78.6% Qwen发布FP8量化Qwen3.5-397B-A17B模型
2026-02-10 Step 3.5 Flash 69.0% 步骤 3.5 Flash:开源 11B 活跃参数的 MoE 模型达到前沿级代理性能
2026-02-05 Claude Opus 4.6 84.0% Anthropic 发布 Claude Opus 4.6,具备 1M 上下文窗口和智能体改进
2026-02-05 Claude Opus 4.6 83.73% Anthropic发布Claude Opus 4.6系统卡,详述能力与安全评估
2026-01-27 Kimi K2.5 74.9% Moonshot发布搭载Agent Swarm技术的Kimi K2.5
2025-11-14 MiroThinker v1.0 (72B variant) 47.1% MiroThinker v1.0 引入开源研究代理的交互式扩展
2025-11-07 Kimi K2 Thinking 60.2% Moonshot AI 发布 Kimi K2 Thinking,一款拥有 1T 参数的开源推理模型
2025-09-16 Tongyi DeepResearch 43.4% 通义发布DeepResearch,开源网页代理性能媲美专有模型
2025-08-06 GLM-4.5 26.4% 智谱AI发布与Claude和DeepSeek匹敌的GLM-4.5模型
2025-04-10 OpenAI Deep Research 51.5% OpenAI