ベンチマーク · agentic

GAIA

14 結果 13 モデル

GAIA(General AI Assistant)は、tools の利用・ウェブ閲覧・複数の情報源にまたがる推論を必要とする現実的な多段階の質問に AI アシスタントが答えられるかを測定します。スコアは正しく答えられた質問の割合(パーセンテージ)です。

詳しく見る
典型的な問題は、一見日常的だが答えが複数の段階に隠れている質問です。たとえば「リンクされた文書内の事実を調べ、それをあるウェブサイトのデータと組み合わせて一つの短い答えを導く」といったもので、一度の検索ではなくブラウジングと tools の利用が求められます。
採点方法
指標は accuracy(正確率)で、最終的な答えが期待される答えと一致した質問の割合です。各質問には曖昧さのない唯一の正解があるため、回答は正解か不正解のいずれかです。
検証方法
回答は参照解との厳密(準厳密)な文字列一致によって自動的に検証され、テストセットの結果は正解が非公開に保たれた公開 leaderboard に提出されます。
重要な理由
人間には簡単だが AI には難しいタスクで、推論・ウェブ閲覧・tools を組み合わせる実用的なアシスタント能力を測るため、自律型 agent の共通のものさしとなっています。
解説付きの例
課題
現在の英語版 Wikipedia を使って、バンド Radiohead が 1993 年から 2007 年まで(両端を含む)にリリースしたスタジオアルバムは何枚ですか?最終回答として整数を 1 つだけ答えてください。
解答
Albums in range: Pablo Honey (1993), The Bends (1995), OK Computer (1997), Kid A (2000), Amnesiac (2001), Hail to the Thief (2003), In Rainbows (2007) → 7. Final answer: 7
解説
GAIA の問題には、ウェブ閲覧と軽い集計によって得られる唯一の明確な正解があります——ここでは日付範囲内のディスコグラフィの項目を数えること(コンピレーションやライブアルバムは除外)。採点は quasi-exact match で行われ、正規化した最終回答の文字列が参照解「7」と完全に一致する必要があります。
0 23 46 69 92 2024-09-27 2025-09-03 2026-08-10 Trase · 35.5 · 2024-09-27 Trase · 67 · 2025-02-21 Enterprise h2oGPTe Agent · 65 · 2024-12-23 Deep Research · 67.4 · 2025-02-04 our agent · 55.1 · 2025-02-04 OpenAI Deep Research · 72.6 · 2025-02-21 OWL · 69.1 · 2025-03-07 Manus AI · 86.5 · 2025-03-10 h2oGPTe Agent · 75 · 2025-03-17 Alita · 75.2 · 2025-05-26 ALITA-G · 83.0 · 2025-10-27 MiroThinker v1.0 (72B variant) · 81.9 · 2025-11-14 Agents-A1 · 46.4 · 2026-07-06 Muse Glimmer · 43.3 · 2026-08-10
Trase Enterprise h2oGPTe Agent Deep Research our agent OpenAI Deep Research OWL Manus AI h2oGPTe Agent Alita ALITA-G MiroThinker v1.0 (72B variant) Agents-A1 Muse Glimmer
タイムライン
日付 モデル スコア ソース
2026-08-10 Muse Glimmer 43.3% Metaが30Bのオープンウェイトエージェントモデル「Muse Glimmer」を1枚のコンシューマーGPUで動作可能として公開
2026-07-06 Agents-A1 46.4pts パラメータのスケールアップではなくホライゾンの拡張:35Bエージェントでトリリオン・パラメータ級のパフォーマンスを実現
2025-11-14 MiroThinker v1.0 (72B variant) 81.9% MiroThinker v1.0がオープンソース研究エージェントのインタラクティブスケーリングを導入
2025-10-27 ALITA-G 83.03% ALITA-GがMCPツールの生成とキュレーションによりエージェントを自己進化させる
2025-05-26 Alita 75.15% Alitaは最小限の事前定義と最大限の自己進化により、スケーラブルなエージェント推論を可能にする
2025-03-17 h2oGPTe Agent 75.0% H2O.aiのh2oGPTe AgentがGAIAベンチマークで75%の精度を達成し首位に
2025-03-10 Manus AI 86.5% GAIAベンチマーク結果を備えた自律エージェントManus AIがローンチ
2025-03-07 OWL 69.09% OWLがGAIAベンチマークで69.09%のスコアにより第1位を獲得
2025-02-21 Trase 67.0% TraseがGAIAリーダーボードで67%のテストスコア、コストは1/100で首位を獲得
2025-02-21 OpenAI Deep Research 72.57% TraseがGAIAリーダーボードで67%のテストスコア、コストは1/100で首位を獲得
2025-02-04 Deep Research 67.36% オープンソースのDeepResearch再現がsmolagentsを用いてGAIAで55.15%を達成
2025-02-04 our agent 55.15% オープンソースのDeepResearch再現がsmolagentsを用いてGAIAで55.15%を達成
2024-12-23 Enterprise h2oGPTe Agent 65.0% H2O.aiのh2oGPTeエージェントがGAIAベンチマークで65%のスコアを記録し首位に
2024-09-27 Trase 35.55% TraseがHugging Face GAIAリーダーボードで35.55%の成功率を記録し首位に