Benchmark · agentic
GAIA
GAIA(General AI Assistant)测试 AI 助手能否回答需要使用 tools、浏览网页并跨多个来源进行推理的现实世界多步骤问题。得分是回答正确的问题所占的百分比。
了解更多
- 示例
- 一个典型题目是看似日常、但答案要经过多个步骤才能得出的问题——例如「在一个链接文档中查找某个事实,再将其与某网站的数据结合,从而得出一个简短答案」——这需要浏览网页和使用 tools,而不是一次查找。
- 评分方式
- 指标是 accuracy(准确率):最终答案与预期答案一致的问题所占比例。每个问题都有一个明确无歧义的标准答案,因此回答非对即错。
- 验证方式
- 答案由系统自动通过与参考答案的精确(准精确)字符串匹配来核验,测试集的结果提交到一个公开的 leaderboard,而正确答案保持私有。
- 为何重要
- 它衡量助手的实用能力——在对人类容易但对 AI 困难的任务上结合推理、网页浏览和 tools——因此成为衡量自主 agent 的常用标尺。
示例解析
任务
使用当前的英文维基百科(Wikipedia),Radiohead 乐队在 1993 年至 2007 年(含)之间发行了多少张录音室专辑?请以单个整数作为最终答案。
解答
Albums in range: Pablo Honey (1993), The Bends (1995), OK Computer (1997), Kid A (2000), Amnesiac (2001), Hail to the Thief (2003), In Rainbows (2007) → 7. Final answer: 7
解析
GAIA 的题目都有唯一明确的标准答案,通过网页浏览加上轻量聚合得出——这里是统计某个日期区间内的唱片目录条目(不含合辑和现场专辑)。评分采用 quasi-exact match:归一化后的最终答案字符串必须与参考答案「7」完全一致。
| 日期 | 模型 | 得分 | 来源 |
|---|---|---|---|
| 2026-08-10 | Muse Glimmer | 43.3% | Meta发布Muse Glimmer:一款在单张消费级GPU上运行的30B开源权重智能体模型 |
| 2026-07-06 | Agents-A1 | 46.4pts | 扩展视界而非参数量:以35B智能体实现万亿参数级性能 |
| 2025-11-14 | MiroThinker v1.0 (72B variant) | 81.9% | MiroThinker v1.0 引入开源研究代理的交互式扩展 |
| 2025-10-27 | ALITA-G | 83.03% | ALITA-G 通过生成和策展 MCP 工具实现代理的自我进化 |
| 2025-05-26 | Alita | 75.15% | Alita 以极少的预定义和最大的自我进化实现可扩展的智能体推理 |
| 2025-03-17 | h2oGPTe Agent | 75.0% | H2O.ai的h2oGPTe Agent在GAIA基准测试中以75%准确率登顶 |
| 2025-03-10 | Manus AI | 86.5% | Manus AI 作为自主代理发布,GAIA 基准测试结果亮眼 |
| 2025-03-07 | OWL | 69.09% | OWL在GAIA基准测试中以69.09%的得分位居第一 |
| 2025-02-21 | Trase | 67.0% | Trase以1/100的成本在GAIA排行榜上登顶,测试得分达67% |
| 2025-02-21 | OpenAI Deep Research | 72.57% | Trase以1/100的成本在GAIA排行榜上登顶,测试得分达67% |
| 2025-02-04 | Deep Research | 67.36% | 开源DeepResearch复现使用smolagents在GAIA上取得55.15%的成绩 |
| 2025-02-04 | our agent | 55.15% | 开源DeepResearch复现使用smolagents在GAIA上取得55.15%的成绩 |
| 2024-12-23 | Enterprise h2oGPTe Agent | 65.0% | H2O.ai的h2oGPTe Agent在GAIA基准测试中以65%的成绩登顶 |
| 2024-09-27 | Trase | 35.55% | Trase以35.55%的成功率登顶Hugging Face GAIA排行榜 |