Бенчмарк · reasoning

Humanity's Last Exam

32 результатов 24 моделей

Humanity's Last Exam (HLE) — это бенчмарк из экспертных вопросов переднего края по множеству областей знаний (математика, естественные науки, гуманитарные науки и другие), намеренно созданный так, чтобы быть предельно сложным для ИИ. Результат выражается в процентах правильных ответов (accuracy).

Подробнее
Пример
Каждое задание — это закрытый экспертный вопрос с единственным правильным ответом: например, продвинутая задача по математике или научный вопрос уровня аспирантуры (иногда с прилагаемым изображением), заданный как выбор из вариантов или как краткий точный ответ.
Метрика
Метрика — accuracy: доля вопросов, на которые модель ответила правильно, в процентах. В некоторых версиях наряду с точностью приводится мера калибровки (уверенности).
Приёмка
У каждого вопроса есть известный правильный ответ, и ответ модели оценивается автоматически по этому эталону (верный вариант для вопросов с выбором, совпадающий краткий ответ) — объективная автоматическая проверка, а не голосование людей.
Почему важно
Стандартные бенчмарки насытились (лучшие модели почти достигли потолка), поэтому HLE стремится быть сложным, различающим тестом на переднем крае экспертных знаний человека — значимым индикатором того, насколько ИИ далёк от рассуждений экспертного уровня.
Разбор примера
Задача
Колибри (отряд Apodiformes) уникально обладают билатерально парной овальной сесамовидной косточкой (sesamoid), встроенной в каудолатеральную часть расширенного крестообразного апоневроза (aponeurosis) прикрепления мышцы m. depressor caudae. Сколько парных сухожилий поддерживает эта сесамовидная косточка? Ответьте одним целым числом.
Решение
4
Разбор
Овальная сесамовидная косточка формируется внутри крестообразного апоневроза мышцы-депрессора хвоста и поддерживает четыре парных сухожилия этого прикрепления — специализированное окостенение, уникальное для анатомии хвоста колибри. HLE оценивает ответ точным совпадением введённого целого числа с эталонным (4) и отдельно запрашивает уверенность для калибровки.
0 16 32 48 64 2025-01-23 2025-11-02 2026-08-13 the model powering deep research · 26.6 · 2025-02-02 Gemini 2.5 Pro (experimental) · 18.8 · 2025-03-25 Gemini 2.5 Pro · 18.8 · 2025-03-25 Gemini 2.5 Pro · 18.8 · 2025-03-25 Gemini 2.5 Pro · 18.8 · 2025-03-26 Gemini 2.5 Pro · 18.8 · 2025-04-05 Grok 4 Heavy · 50.7 · 2025-07-09 GPT-5 Pro · 42 · 2025-08-07 Tongyi DeepResearch · 32.9 · 2025-09-16 DeepSeek-V3.2-Exp · 56.5 · 2025-09-29 Kimi K2 Thinking · 44.9 · 2025-11-07 MiroThinker v1.0 (72B variant) · 37.7 · 2025-11-14 Gemini 3 Pro · 37.5 · 2025-11-18 Gemini 3 Pro · 37.5 · 2025-11-18 Gemini 3 Deep Think · 41 · 2025-11-18 Gemini 3 Deep Think · 41 · 2025-11-18 Gemini 3 Deep Think · 48.4 · 2026-02-12 Kimi K2.5 · 51.8 · 2026-01-29 Claude Opus 4.6 · 53 · 2026-02-05 Claude Opus 4.6 · 40 · 2026-02-05 Claude Opus 4.6 · 53 · 2026-03-06 Claude Opus 4.7 · 46.9 · 2026-04-25 GPT-5.5 · 41.4 · 2026-04-25 Claude Fable 5 · 53 · 2026-06-09 Agents-A1 · 47.6 · 2026-06-30 Claude Opus 4.8 · 46 · 2026-07-01 PoTRE · 49.9 · 2026-07-23 Inkling-Small · 31.6 · 2026-08-03 DeepSeek-V4-Pro · 60 · 2026-08-13 DeepSeek R1 (text-only) · 9.4 · 2025-01-23 Grok 4 · 25.4 · 2025-07-09 GPT-5 · 24.8 · 2025-08-07
the model powering deep research Gemini 2.5 Pro (experimental) Gemini 2.5 Pro Grok 4 Heavy GPT-5 Pro Tongyi DeepResearch DeepSeek-V3.2-Exp Kimi K2 Thinking MiroThinker v1.0 (72B variant) Gemini 3 Pro Gemini 3 Deep Think Kimi K2.5 Claude Opus 4.6 Claude Opus 4.7 GPT-5.5 Claude Fable 5 Agents-A1 Claude Opus 4.8 PoTRE Inkling-Small DeepSeek-V4-Pro DeepSeek R1 (text-only) Grok 4 GPT-5
Хронология
Дата Модель Результат Источник
2026-08-13 DeepSeek-V4-Pro 60.0% GA-релиз DeepSeek-V4-Pro улучшает возможности агентов и добавляет поддержку API ответов
2026-08-03 Inkling-Small 31.6% Thinking Machines Lab выпустила Inkling-Small: открытую мультимодальную MoE-модель с 276B весов
2026-07-23 PoTRE 49.92% PoTRE представляет гетерогенную многоагентную архитектуру для рассуждений во время тестирования
2026-07-01 Claude Opus 4.8 46.0% Anthropic выпустила Claude Opus 4.8 с адаптивным рассуждением и улучшенной честностью
2026-06-30 Agents-A1 47.6pts Масштабирование горизонта, а не параметров: достижение производительности триллионных моделей с агентом на 35B
2026-06-09 Claude Fable 5 53.0% Claude Fable 5 выходит на первое место в Интеллектуальном индексе Artificial Analysis
2026-04-25 Claude Opus 4.7 46.9% OpenAI выпустила GPT-5.5: модель с нуля переобученная для нативной омнимодальной обработки
2026-04-25 GPT-5.5 41.4% OpenAI выпустила GPT-5.5: модель с нуля переобученная для нативной омнимодальной обработки
2026-03-06 Claude Opus 4.6 53.0% Anthropic выпустила системную карточку Claude Opus 4.6 с описанием возможностей и оценок безопасности
2026-02-12 Gemini 3 Deep Think 48.4% Google выпустила обновлённый Gemini 3 Deep Think с новыми результатами бенчмарков
2026-02-05 Claude Opus 4.6 53.0% Anthropic опубликовала системную карточку Claude Opus 4.6 с описанием возможностей и оценок безопасности
2026-02-05 Claude Opus 4.6 40.0% Anthropic выпустила Claude Opus 4.6 с контекстным окном на 1M токенов и улучшениями для агентов
2026-01-29 Kimi K2.5 51.8% Moonshot выпустила мультимодальную агентную модель Kimi K2.5
2025-11-18 Gemini 3 Pro 37.5% Google выпустила Gemini 3 Pro с передовыми возможностями рассуждения и мультимодальности
2025-11-18 Gemini 3 Deep Think 41.0% Google выпустила Gemini 3 Pro с передовыми возможностями рассуждения и мультимодальности
2025-11-18 Gemini 3 Pro 37.5% Google выпустила Gemini 3 Pro с передовыми возможностями рассуждения и мультимодальности
2025-11-18 Gemini 3 Deep Think 41.0% Google выпустила Gemini 3 Pro с передовыми возможностями рассуждения и мультимодальности
2025-11-14 MiroThinker v1.0 (72B variant) 37.7% MiroThinker v1.0 представляет интерактивное масштабирование для исследовательских агентов с открытым исходным кодом
2025-11-07 Kimi K2 Thinking 44.9% Moonshot AI выпустила Kimi K2 Thinking, открытую модель рассуждений на 1 трлн параметров
2025-09-29 DeepSeek-V3.2-Exp 56.53% DeepSeek выпустила DeepSeek-V3.2-Exp с разреженным вниманием для эффективности при работе с длинным контекстом
2025-09-16 Tongyi DeepResearch 32.9% Tongyi выпустила DeepResearch — открытый веб-агент, сопоставимый по производительности с проприетарными решениями
2025-08-07 GPT-5 Pro 42.0% OpenAI запускает унифицированную GPT-5 с маршрутизацией в реальном времени и бесплатным доступом
2025-08-07 GPT-5 24.8% OpenAI
2025-07-09 Grok 4 Heavy 50.7% xAI выпустила Grok 4 с масштабированным обучением с подкреплением и нативным использованием инструментов
2025-07-09 Grok 4 25.4% xAI
2025-04-05 Gemini 2.5 Pro 18.8% Google расширяет доступ к Gemini 2.5 Pro на фоне высоких результатов в бенчмарках
2025-03-26 Gemini 2.5 Pro 18.8% Google выпустила экспериментальную модель рассуждений Gemini 2.5 Pro с контекстом на 1 млн токенов
2025-03-25 Gemini 2.5 Pro (experimental) 18.8% Google DeepMind выпустила экспериментальную модель Gemini 2.5 Pro
2025-03-25 Gemini 2.5 Pro 18.8% Google представляет модель мышления Gemini 2.5 Pro
2025-03-25 Gemini 2.5 Pro 18.8% Google представляет экспериментальную модель Gemini 2.5 Pro
2025-02-02 the model powering deep research 26.6% OpenAI запускает функцию глубокого исследования в ChatGPT как агентную возможность
2025-01-23 DeepSeek R1 (text-only) 9.4% Humanity's Last Exam