벤치마크 · agentic

GAIA

14 결과 13 모델

GAIA(General AI Assistant)는 tools 사용, 웹 브라우징, 여러 출처에 걸친 추론이 필요한 현실적인 다단계 질문에 AI 어시스턴트가 답할 수 있는지를 평가합니다. 점수는 정확히 답한 질문의 비율(퍼센트)입니다.

자세히 보기
예시
전형적인 문항은 일상적으로 보이지만 답이 여러 단계에 걸쳐 숨어 있는 질문입니다. 예를 들어 "링크된 문서에서 어떤 사실을 찾은 뒤 이를 어떤 웹사이트의 데이터와 결합해 하나의 짧은 답을 도출하기"처럼, 한 번의 검색이 아니라 브라우징과 tools 사용이 필요합니다.
채점 방식
지표는 accuracy(정확도)로, 최종 답이 기대한 답과 일치하는 질문의 비율입니다. 각 질문에는 모호하지 않은 단 하나의 기준 정답이 있으므로 응답은 맞거나 틀리거나 둘 중 하나입니다.
검증 방식
답은 기준 정답과의 정확(준정확) 문자열 일치로 자동 검증되며, 테스트 세트 결과는 정답이 비공개로 유지되는 공개 leaderboard에 제출됩니다.
왜 중요한가
사람에게는 쉽지만 AI에게는 어려운 과제에서 추론, 웹 브라우징, tools를 결합하는 실용적 어시스턴트 능력을 측정하므로 자율 agent를 재는 흔한 잣대가 됩니다.
예제 풀이
문제
현재 영어판 Wikipedia를 사용하여, 밴드 Radiohead가 1993년부터 2007년까지(양 끝 포함) 발매한 정규 앨범은 몇 장입니까? 최종 답으로 정수 하나만 제시하세요.
해답
Albums in range: Pablo Honey (1993), The Bends (1995), OK Computer (1997), Kid A (2000), Amnesiac (2001), Hail to the Thief (2003), In Rainbows (2007) → 7. Final answer: 7
풀이
GAIA 문항에는 웹 탐색과 가벼운 집계로 도달하는 유일하고 명확한 정답이 있습니다 — 여기서는 특정 날짜 범위 안의 디스코그래피 항목을 세는 것입니다(컴필레이션과 라이브 앨범은 제외). 채점은 quasi-exact match로 이루어지며, 정규화된 최종 답 문자열이 참조 답 «7»과 정확히 일치해야 합니다.
0 23 46 69 92 2024-09-27 2025-09-03 2026-08-10 Trase · 35.5 · 2024-09-27 Trase · 67 · 2025-02-21 Enterprise h2oGPTe Agent · 65 · 2024-12-23 Deep Research · 67.4 · 2025-02-04 our agent · 55.1 · 2025-02-04 OpenAI Deep Research · 72.6 · 2025-02-21 OWL · 69.1 · 2025-03-07 Manus AI · 86.5 · 2025-03-10 h2oGPTe Agent · 75 · 2025-03-17 Alita · 75.2 · 2025-05-26 ALITA-G · 83.0 · 2025-10-27 MiroThinker v1.0 (72B variant) · 81.9 · 2025-11-14 Agents-A1 · 46.4 · 2026-07-06 Muse Glimmer · 43.3 · 2026-08-10
Trase Enterprise h2oGPTe Agent Deep Research our agent OpenAI Deep Research OWL Manus AI h2oGPTe Agent Alita ALITA-G MiroThinker v1.0 (72B variant) Agents-A1 Muse Glimmer
타임라인
날짜 모델 점수 출처
2026-08-10 Muse Glimmer 43.3% Meta가 단일 소비자용 GPU에서 구동되는 30B 오픈 가중치 에이전트 모델인 Muse Glimmer를 출시
2026-07-06 Agents-A1 46.4pts 파라미터가 아닌 에이전트 지평 확장: 35B 에이전트로 트릴리언 파라미터 성능 달성
2025-11-14 MiroThinker v1.0 (72B variant) 81.9% MiroThinker v1.0이 오픈소스 연구 에이전트를 위한 상호작용 스케일링 도입
2025-10-27 ALITA-G 83.03% ALITA-G가 MCP 도구 생성 및 큐레이션을 통해 에이전트 자체 진화
2025-05-26 Alita 75.15% Alita는 최소한의 사전 정의와 최대의 자기 진화를 통해 확장 가능한 에이전트적 추론을 가능하게 한다
2025-03-17 h2oGPTe Agent 75.0% H2O.ai의 h2oGPTe 에이전트, GAIA 벤치마크에서 75% 정확도로 최상위 기록
2025-03-10 Manus AI 86.5% GAIA 벤치마크 결과와 함께 자율 에이전트 Manus AI 출시
2025-03-07 OWL 69.09% OWL, GAIA 벤치마크에서 69.09% 점수로 1위 달성
2025-02-21 Trase 67.0% 트레이스, GAIA 리더보드에서 1/100 비용으로 67% 테스트 점수 달성
2025-02-21 OpenAI Deep Research 72.57% 트레이스, GAIA 리더보드에서 1/100 비용으로 67% 테스트 점수 달성
2025-02-04 Deep Research 67.36% 오픈소스 DeepResearch 재현이 smolagents를 사용해 GAIA에서 55.15% 달성
2025-02-04 our agent 55.15% 오픈소스 DeepResearch 재현이 smolagents를 사용해 GAIA에서 55.15% 달성
2024-12-23 Enterprise h2oGPTe Agent 65.0% H2O.ai의 h2oGPTe 에이전트, GAIA 벤치마크에서 65% 점수로 최상위 달성
2024-09-27 Trase 35.55% Trase, Hugging Face GAIA 리더보드에서 35.55% 성공률로 1위 등극