ベンチマーク · agentic

BrowseComp

26 結果 23 モデル

BrowseComp は、Web を閲覧する AI エージェント向けの OpenAI のベンチマークで、インターネット上に散らばった見つけにくい事実を追跡できるかを検証します。結果は正解した問題の割合(パーセンテージ)で示されます。

詳しく見る
典型的な問題では、短い事実的な答え(名前・日付・数値など)が Web の奥深くに埋もれており、それを見つけるには多数のページを横断する粘り強い多段階の検索が必要になります。
採点方法
指標は正解率(accuracy)で、エージェントの答えが唯一の既知の正解と一致した問題の割合です。
検証方法
回答はあらかじめ定められた正解と一致した場合に受理されます(完全一致方式)。問題は、答えを見つけるのは難しいが与えられれば検証は容易になるように作られています。
重要な理由
通常のチャットボットにはない能力——多段階にわたる粘り強く深い Web リサーチ——を測るため、強力なモデルにとってもエージェント的ブラウジングの手強いテストであり続けます。
解説付きの例
課題
BrowseComp の問題:「2010年から2015年の間に公開された長編映画で、(1) アカデミー賞作品賞を受賞し、(2) ある一つの秘密救出作戦を描き、(3) 主演を務めた本人が監督し、(4) クライマックスがテヘランの空港で展開するものを挙げよ。映画のタイトルのみを答えよ。」
解答
制約は一本の映画に収束する——2010〜2015年のアカデミー賞作品賞受賞作で、主演自身が監督した秘密救出ドラマであり、クライマックスがテヘランの空港で展開する作品。最終回答:Argo (2012)、監督・主演は Ben Affleck。
解説
各手がかりが候補を絞り込む——2010〜2015年の作品賞受賞作、次に主演自身が監督した救出ドラマ、最後にテヘランの空港でクライマックスを迎える一作——残るのは Argo だけで、Ben Affleck が監督と主演を兼ねている。BrowseComp は短い自由記述の回答を参照解答と完全一致またはモデル判定で照合するため、「Argo」は正解と判定される。
0 24.5 49 73.5 98 2025-04-10 2025-12-11 2026-08-13 GLM-4.5 · 26.4 · 2025-08-06 Tongyi DeepResearch · 43.4 · 2025-09-16 Kimi K2 Thinking · 60.2 · 2025-11-07 MiroThinker v1.0 (72B variant) · 47.1 · 2025-11-14 Kimi K2.5 · 74.9 · 2026-01-27 Claude Opus 4.6 · 84 · 2026-02-05 Claude Opus 4.6 · 83.7 · 2026-02-05 Claude Opus 4.6 · 83.7 · 2026-03-06 Step 3.5 Flash · 69 · 2026-02-10 Qwen3.5-397B-A17B · 78.6 · 2026-02-16 Opus 4.6 · 84 · 2026-04-21 GPT-5.4 · 82.7 · 2026-04-21 GPT-5.4 Pro · 89.3 · 2026-04-21 Gemini 3.1 Pro · 85.9 · 2026-04-23 GPT-5.5 · 84.4 · 2026-04-23 Agents-A1 · 75.5 · 2026-07-06 GPT-5.6 Sol · 92.2 · 2026-07-09 Mach-Mind-4-Flash · 72.3 · 2026-07-13 Mach-Mind-4-Flash · 72.3 · 2026-07-13 Qwen3-4B · 35.6 · 2026-07-16 Qwen3-30B-A3B · 42.6 · 2026-07-16 GPT-Live-1 · 75.2 · 2026-07-17 Kimi K3 · 91.2 · 2026-07-17 GPT-5.6 Luna (Extra High) · 84.0 · 2026-08-13 GPT-5.5 (Extra High) · 84.4 · 2026-08-13 OpenAI Deep Research · 51.5 · 2025-04-10
GLM-4.5 Tongyi DeepResearch Kimi K2 Thinking MiroThinker v1.0 (72B variant) Kimi K2.5 Claude Opus 4.6 Step 3.5 Flash Qwen3.5-397B-A17B Opus 4.6 GPT-5.4 GPT-5.4 Pro Gemini 3.1 Pro GPT-5.5 Agents-A1 GPT-5.6 Sol Mach-Mind-4-Flash Qwen3-4B Qwen3-30B-A3B GPT-Live-1 Kimi K3 GPT-5.6 Luna (Extra High) GPT-5.5 (Extra High) OpenAI Deep Research
タイムライン
日付 モデル スコア ソース
2026-08-13 GPT-5.6 Luna (Extra High) 84.04% OpenAIが手頃な価格で高性能なエージェントワークフローに対応するGPT-5.6をリリース
2026-08-13 GPT-5.5 (Extra High) 84.36% OpenAIが手頃な価格で高性能なエージェントワークフローに対応するGPT-5.6をリリース
2026-07-17 Kimi K3 91.2% Moonshot AIが2.8TパラメータのMoEモデル「Kimi K3」を1Mコンテキストで公開
2026-07-17 GPT-Live-1 75.2% OpenAIがフルデュプレックス音声モデルをリリース、ドイツの裁判所がGoogleにAIオーバビューの責任を課す
2026-07-16 Qwen3-4B 35.6% TRACEはターンレベルの信用推定により、長期エージェントのツール利用を改善する
2026-07-16 Qwen3-30B-A3B 42.6% TRACEはターンレベルの信用推定により、長期エージェントのツール利用を改善する
2026-07-13 Mach-Mind-4-Flash 72.31% Mach-Mind-4-Flash: 35B MoE エージェントモデルがポストトレーニング最適化により大規模モデルに匹敵
2026-07-13 Mach-Mind-4-Flash 72.31% Mach-Mind-4-Flash: 35B MoE エージェントモデルがポストトレーニング最適化により大規模モデルに匹敵
2026-07-09 GPT-5.6 Sol 92.2% OpenAI、Sol、Terra、Lunaモデルを搭載したGPT-5.6ファミリーをリリース
2026-07-06 Agents-A1 75.5pts パラメータのスケールアップではなくホライゾンの拡張:35Bエージェントでトリリオン・パラメータ級のパフォーマンスを実現
2026-04-23 Gemini 3.1 Pro 85.9% OpenAIがGPT-5.5をリリース、エージェント機能搭載とAPI価格の倍増
2026-04-23 GPT-5.5 84.4% OpenAIがGPT-5.5をリリース、エージェント機能搭載とAPI価格の倍増
2026-04-21 Opus 4.6 84.0% Google、Gemini 3.1 Proを基盤とするDeep ResearchおよびDeep Research Maxエージェントを発表
2026-04-21 GPT-5.4 82.7% Google、Gemini 3.1 Proを基盤とするDeep ResearchおよびDeep Research Maxエージェントを発表
2026-04-21 GPT-5.4 Pro 89.3% Google、Gemini 3.1 Proを基盤とするDeep ResearchおよびDeep Research Maxエージェントを発表
2026-03-06 Claude Opus 4.6 83.73% AnthropicがClaude Opus 4.6のシステムカードを公開し、機能と安全性評価の詳細を明かす
2026-02-16 Qwen3.5-397B-A17B 78.6% QwenがFP8量子化されたQwen3.5-397B-A17Bモデルをリリース
2026-02-10 Step 3.5 Flash 69.0% ステップ3.5 Flash: 11BアクティブなMoEモデルが最前級のエージェント性能を実現
2026-02-05 Claude Opus 4.6 84.0% Anthropicが1Mコンテキストウィンドウとエージェント機能の改善を備えたClaude Opus 4.6をリリース
2026-02-05 Claude Opus 4.6 83.73% AnthropicがClaude Opus 4.6のシステムカードを公開し、能力と安全性評価の詳細を明記
2026-01-27 Kimi K2.5 74.9% Moonshotがエージェントスワーム技術搭載のKimi K2.5をリリース
2025-11-14 MiroThinker v1.0 (72B variant) 47.1% MiroThinker v1.0がオープンソース研究エージェントのインタラクティブスケーリングを導入
2025-11-07 Kimi K2 Thinking 60.2% Moonshot AIがKimi K2 Thinkingをリリース、オープンソースの1Tパラメータ推論モデル
2025-09-16 Tongyi DeepResearch 43.4% TongyiがProprietaryなパフォーマンスに匹敵するオープンソースのWebエージェントDeepResearchをリリース
2025-08-06 GLM-4.5 26.4% 智譜AIがClaudeやDeepSeekに匹敵するGLM-4.5モデルをリリース
2025-04-10 OpenAI Deep Research 51.5% OpenAI