Бенчмарк · agentic

GAIA

13 результатов 12 моделей

GAIA (General AI Assistant) проверяет, могут ли ИИ-ассистенты отвечать на реальные многошаговые вопросы, требующие использования tools, просмотра веб-страниц и рассуждений по нескольким источникам. Оценка — это процент правильно отвеченных вопросов.

Подробнее
Пример
Типичный пункт — простой на вид вопрос, ответ на который спрятан за несколькими шагами: например, «найти факт в приложенном документе, а затем объединить его с данными с веб-сайта, чтобы получить один короткий ответ», — что требует просмотра страниц и использования tools, а не одного поиска.
Метрика
Метрика — accuracy (точность): доля вопросов, чей итоговый ответ совпадает с ожидаемым. У каждого вопроса есть один однозначный эталонный ответ, поэтому ответ либо верный, либо неверный.
Приёмка
Ответы проверяются автоматически точным (квази-точным) сравнением строк с эталонным ответом, а результаты на тестовом наборе отправляются в публичный leaderboard, где правильные ответы держатся в секрете.
Почему важно
Он измеряет практические способности ассистента — сочетание рассуждений, веб-просмотра и tools в задачах, лёгких для людей, но трудных для ИИ, — что делает его распространённым эталоном для автономных agents.
Разбор примера
Задача
Используя текущую английскую Wikipedia, сколько студийных альбомов выпустила группа Radiohead с 1993 по 2007 год включительно? Дайте один целочисленный ответ.
Решение
Albums in range: Pablo Honey (1993), The Bends (1995), OK Computer (1997), Kid A (2000), Amnesiac (2001), Hail to the Thief (2003), In Rainbows (2007) → 7. Final answer: 7
Разбор
У заданий GAIA есть один однозначный эталонный ответ, получаемый через веб-поиск и несложное агрегирование — здесь это подсчёт записей дискографии в заданном диапазоне дат (сборники и концертные альбомы исключаются). Оценивается методом quasi-exact match: нормализованная строка итогового ответа должна точно совпасть с эталоном «7».
0 23 46 69 92 2024-09-27 2025-08-13 2026-06-30 Trase · 35.5 · 2024-09-27 Trase · 67 · 2025-02-21 Enterprise h2oGPTe Agent · 65 · 2024-12-23 our agent · 55.1 · 2025-02-04 Deep Research · 67.4 · 2025-02-04 OpenAI Deep Research · 72.6 · 2025-02-21 OWL · 69.1 · 2025-03-07 Manus AI · 86.5 · 2025-03-10 h2oGPTe Agent · 75 · 2025-03-17 Alita · 75.2 · 2025-05-26 ALITA-G · 83.0 · 2025-10-27 MiroThinker v1.0 (72B variant) · 81.9 · 2025-11-14 Agents-A1 · 46.4 · 2026-06-30
Trase Enterprise h2oGPTe Agent our agent Deep Research OpenAI Deep Research OWL Manus AI h2oGPTe Agent Alita ALITA-G MiroThinker v1.0 (72B variant) Agents-A1
Хронология
Дата Модель Результат Источник
2026-06-30 Agents-A1 46.4pts Масштабирование горизонта, а не параметров: достижение производительности триллионных моделей с агентом на 35B
2025-11-14 MiroThinker v1.0 (72B variant) 81.9% MiroThinker v1.0 представляет интерактивное масштабирование для исследовательских агентов с открытым исходным кодом
2025-10-27 ALITA-G 83.03% ALITA-G самостоятельно эволюционирует агентов путем генерации и курирования MCP-инструментов
2025-05-26 Alita 75.15% Alita обеспечивает масштабируемое агентное рассуждение с минимальным предварительным определением и максимальной саморазвиваемостью
2025-03-17 h2oGPTe Agent 75.0% Агент h2oGPTe от H2O.ai лидирует в бенчмарке GAIA с точностью 75%
2025-03-10 Manus AI 86.5% Manus AI запускается как автономный агент с результатами бенчмарка GAIA
2025-03-07 OWL 69.09% OWL занимает #1 в бенчмарке GAIA с результатом 69.09%
2025-02-21 OpenAI Deep Research 72.57% Trase возглавил лидерборд GAIA с результатом 67% на тесте при стоимости в 1/100
2025-02-21 Trase 67.0% Trase возглавил лидерборд GAIA с результатом 67% на тесте при стоимости в 1/100
2025-02-04 our agent 55.15% Воспроизведение Open-source DeepResearch достигает 55.15% на GAIA с использованием smolagents
2025-02-04 Deep Research 67.36% Воспроизведение Open-source DeepResearch достигает 55.15% на GAIA с использованием smolagents
2024-12-23 Enterprise h2oGPTe Agent 65.0% Агент h2oGPTe от H2O.ai занимает первое место в бенчмарке GAIA с результатом 65%
2024-09-27 Trase 35.55% Trase возглавляет лидерборд Hugging Face GAIA с показателем успешности 35.55%