Бенчмарк · reasoning

GPQA Diamond

61 результатов 44 моделей

GPQA Diamond — самый сложный поднабор GPQA, набор вопросов с выбором ответа уровня аспирантуры и «недоступных для гуглинга» по биологии, физике и химии, составленных экспертами. Модель оценивается по проценту точности при выборе правильного ответа.

Подробнее
Пример
Типичный вопрос — трудная задача с выбором из вариантов, требующая рассуждений уровня аспиранта: например, вопрос по химии, описывающий механизм реакции и спрашивающий, какой из четырёх вариантов даёт правильный продукт, настолько сложный, что неспециалист не решит его даже с поиском в интернете.
Метрика
Оценка — это доля правильно отвеченных вопросов (точность): число заданий, где модель выбрала верный вариант, делённое на общее число вопросов.
Приёмка
Каждый ответ проверяется автоматически точным совпадением с единственным известным правильным вариантом, поэтому участие человека не требуется; сам ярлык «Diamond» был присвоен при создании датасета — когда квалифицированные эксперты сходились в ответе, а неспециалисты всё равно ошибались.
Почему важно
Это один из самых строгих тестов настоящего научного мышления экспертного уровня (а не фактов, которые можно найти в поиске), поэтому высокий результат на GPQA Diamond — заметный сигнал того, что передовая модель способна рассуждать над сложными узкоспециальными задачами.
Разбор примера
Задача
Электрон находится в (ненормированном) спиновом состоянии (3i, 4)ᵀ. Найдите среднее значение проекции спина на ось y, S_y. Варианты: (A) 12ħ/25 (B) −12ħ/25 (C) 25ħ/2 (D) −25ħ/2.
Решение
Norm: |3i|²+|4|²=25. σ_y=[[0,−i],[i,0]]. ⟨S_y⟩=(ħ/2)·(ψ†σ_yψ)/(ψ†ψ)=(ħ/2)·(−24/25)=−12ħ/25 → (B).
Разбор
По формуле ⟨S_y⟩ = ψ†S_yψ / ψ†ψ с S_y = (ħ/2)σ_y числитель ψ†σ_yψ = −24, норма ψ†ψ = 25, откуда −12ħ/25 (вариант B). GPQA оценивает по точному совпадению выбранной буквы с эталонным ответом.
0 25 50 75 100 2023-11-20 2025-03-27 2026-08-03 GPT-4 based baseline · 39 · 2023-11-20 Claude 3.5 Sonnet · 59.4 · 2024-06-20 Claude 3.5 Sonnet · 59.4 · 2024-06-20 Claude 3.5 Sonnet · 65 · 2025-02-26 Qwen2-72B · 37.9 · 2024-07-15 Qwen2-72B · 37.9 · 2024-07-15 QwQ-32B-Preview · 65.2 · 2024-11-28 o3 · 87.7 · 2024-12-20 o3 · 87.7 · 2026-03-25 Grok 3 (Think) · 84.6 · 2025-02-19 Claude 3.7 Sonnet · 84.8 · 2025-02-24 Claude 3.7 Sonnet · 84.8 · 2025-02-26 Grok 3 Beta · 84.6 · 2025-02-26 DeepSeek R1 · 71.5 · 2025-02-26 OpenAI o3-mini · 78 · 2025-02-26 GPT-4.5 · 71.4 · 2025-03-05 Grok 3 · 84.6 · 2025-03-11 DeepSeek-V3-0324 · 68.4 · 2025-03-24 Gemini 2.5 Pro (experimental) · 84 · 2025-03-25 Gemini 2.5 Pro · 84 · 2025-03-25 Gemini 2.5 Pro · 84 · 2025-03-26 Gemini 2.5 Pro · 84 · 2025-04-05 Seed1.5-Thinking · 77.3 · 2025-04-10 GPT‑4.1 nano · 50.3 · 2025-04-14 Gemini 2.0 Flash · 60.1 · 2025-04-15 Claude Sonnet 4 · 70 · 2025-05-22 Claude Opus 4 · 74.9 · 2025-05-22 Claude Opus 4 · 74.9 · 2025-05-22 Deepseek-R1-0528 · 81 · 2025-05-30 Kimi K2 · 75.1 · 2025-07-28 Kimi K2 · 75.1 · 2025-07-28 GPT-5 pro · 88.4 · 2025-08-07 GPT-5 pro · 89.4 · 2025-08-07 GPT-5 Pro · 88.4 · 2025-08-07 DeepSeek-V3.1-Terminus · 74.2 · 2025-09-22 Claude Sonnet 4.5 · 83.4 · 2025-09-30 GPT-5.2 · 92.4 · 2025-10-24 GPT-4 · 39 · 2025-10-24 Claude 3 Opus · 60 · 2025-10-24 O1 · 77 · 2025-10-24 Claude Opus 4.6 · 91.3 · 2025-10-24 Claude Opus 4.6 · 91.3 · 2026-02-05 Gemini 3 Pro · 91.9 · 2025-10-24 Gemini 3 Pro · 91.9 · 2025-11-18 Gemini 3 Pro · 91.9 · 2025-11-18 Gemini 3 Pro · 93 · 2025-12-04 Gemini 3.1 Pro Preview · 94.1 · 2025-10-24 Aristotle-X1 · 92.4 · 2025-10-24 Gemini 3 Deep Think · 93.8 · 2025-11-18 Gemini 3 Deep Think · 93.8 · 2025-11-18 GPT-5.2 Thinking · 92.4 · 2025-12-11 GPT-5.2 Thinking · 92.4 · 2025-12-11 GPT-5.2 Pro · 93.2 · 2025-12-11 GPT-5.2 Pro · 93.2 · 2025-12-11 Kimi K2.5 · 87.6 · 2026-01-27 Grok 4 · 87.7 · 2026-02-25 GPT-Live-1 · 84.2 · 2026-07-17 Kimi K3 · 93.5 · 2026-07-17 Inkling-Small · 89.5 · 2026-08-03 Qwen3.8-Max · 92.6 · 2026-08-03 OpenAI o3 · 87.7 · 2025-04-16
GPT-4 based baseline Claude 3.5 Sonnet Qwen2-72B QwQ-32B-Preview o3 Grok 3 (Think) Claude 3.7 Sonnet Grok 3 Beta DeepSeek R1 OpenAI o3-mini GPT-4.5 Grok 3 DeepSeek-V3-0324 Gemini 2.5 Pro (experimental) Gemini 2.5 Pro Seed1.5-Thinking GPT‑4.1 nano Gemini 2.0 Flash Claude Sonnet 4 Claude Opus 4 Deepseek-R1-0528 Kimi K2 GPT-5 pro GPT-5 Pro DeepSeek-V3.1-Terminus Claude Sonnet 4.5 GPT-5.2 GPT-4 Claude 3 Opus O1 Claude Opus 4.6 Gemini 3 Pro Gemini 3.1 Pro Preview Aristotle-X1 Gemini 3 Deep Think GPT-5.2 Thinking GPT-5.2 Pro Kimi K2.5 Grok 4 GPT-Live-1 Kimi K3 Inkling-Small Qwen3.8-Max OpenAI o3
Хронология
Дата Модель Результат Источник
2026-08-03 Qwen3.8-Max 92.6% Alibaba выпустила Qwen3.8-Max — MoE-модель с 2,4 трлн параметров
2026-08-03 Inkling-Small 89.5% Thinking Machines Lab выпустила Inkling-Small: открытую мультимодальную MoE-модель с 276B весов
2026-07-17 Kimi K3 93.5% Moonshot AI выпустила открытую модель Kimi K3 с 2,8 трлн параметров и контекстом в 1 млн токенов
2026-07-17 GPT-Live-1 84.2% OpenAI выпустила полнодуплексные голосовые модели, а немецкий суд признал Google ответственным за ИИ-обзоры
2026-03-25 o3 87.7% OpenAI объявляет о выводе o3 из ChatGPT и публикует результаты бенчмарков
2026-02-25 Grok 4 87.7% xAI выпустила модель рассуждений Grok 4 с сильными результатами в агентных и кодовых тестах
2026-02-05 Claude Opus 4.6 91.3% Anthropic выпустила Claude Opus 4.6 с контекстным окном на 1M токенов и улучшениями для агентов
2026-01-27 Kimi K2.5 87.6% Moonshot выпустила Kimi K2.5 с технологией Agent Swarm
2025-12-11 GPT-5.2 Thinking 92.4% OpenAI представляет GPT-5.2 с улучшенными возможностями программирования, работы с длинным контекстом и рассуждений
2025-12-11 GPT-5.2 Thinking 92.4% OpenAI выпустила модели GPT-5.2 Pro и Thinking для науки и математики
2025-12-11 GPT-5.2 Pro 93.2% OpenAI выпустила модели GPT-5.2 Pro и Thinking для науки и математики
2025-12-11 GPT-5.2 Pro 93.2% OpenAI представляет GPT-5.2 с улучшенными возможностями программирования, работы с длинным контекстом и рассуждений
2025-12-04 Gemini 3 Pro 93.0% Epoch AI запускает Центр передовых дата-центров и анализирует бенчмарк OSWorld
2025-11-18 Gemini 3 Pro 91.9% Google выпустила Gemini 3 Pro с передовыми возможностями рассуждения и мультимодальности
2025-11-18 Gemini 3 Deep Think 93.8% Google выпустила Gemini 3 Pro с передовыми возможностями рассуждения и мультимодальности
2025-11-18 Gemini 3 Pro 91.9% Google выпустила Gemini 3 Pro с передовыми возможностями рассуждения и мультимодальности
2025-11-18 Gemini 3 Deep Think 93.8% Google выпустила Gemini 3 Pro с передовыми возможностями рассуждения и мультимодальности
2025-10-24 GPT-5.2 92.4% Бенчмарк GPQA-Diamond: результаты, таблица лидеров и сравнение моделей ИИ
2025-10-24 GPT-4 39.0% Бенчмарк GPQA-Diamond: результаты, таблица лидеров и сравнение моделей ИИ
2025-10-24 Claude 3 Opus 60.0% Бенчмарк GPQA-Diamond: результаты, таблица лидеров и сравнение моделей ИИ
2025-10-24 O1 77.0% Бенчмарк GPQA-Diamond: результаты, таблица лидеров и сравнение моделей ИИ
2025-10-24 Claude Opus 4.6 91.3% Бенчмарк GPQA-Diamond: результаты, таблица лидеров и сравнение моделей ИИ
2025-10-24 Gemini 3 Pro 91.9% Бенчмарк GPQA-Diamond: результаты, таблица лидеров и сравнение моделей ИИ
2025-10-24 Gemini 3.1 Pro Preview 94.1% Бенчмарк GPQA-Diamond: результаты, таблица лидеров и сравнение моделей ИИ
2025-10-24 Aristotle-X1 92.4% Бенчмарк GPQA-Diamond: результаты, таблица лидеров и сравнение моделей ИИ
2025-09-30 Claude Sonnet 4.5 83.4% Anthropic выпустила Claude Sonnet 4.5 с улучшенными возможностями программирования и агентов
2025-09-22 DeepSeek-V3.1-Terminus 74.24% DeepSeek выпустила DeepSeek-V3.1-Terminus с исправлениями языка и агентов
2025-08-07 GPT-5 pro 88.4% OpenAI представляет GPT-5 с единым маршрутизатором и рассуждениями экспертного уровня
2025-08-07 GPT-5 Pro 88.4% OpenAI запускает GPT-5 с адаптивным рассуждением и единой архитектурой
2025-08-07 GPT-5 pro 89.4% OpenAI запускает унифицированную GPT-5 с маршрутизацией в реальном времени и бесплатным доступом
2025-07-28 Kimi K2 75.1% Kimi K2: открытая MoE-модель с 1T параметров и оптимизатором MuonClip
2025-07-28 Kimi K2 75.1% Moonshot выпустила Kimi K2, открытую агентную MoE-модель с 32B активных параметров
2025-05-30 Deepseek-R1-0528 81.0% DeepSeek обновляет модель R1 с улучшенными способностями к рассуждению и результатами на бенчмарках
2025-05-22 Claude Sonnet 4 70.0% Anthropic представляет Claude Opus 4 и Sonnet 4 с расширенным мышлением и использованием инструментов
2025-05-22 Claude Opus 4 74.9% Anthropic выпустила Claude Opus 4 и Sonnet 4 с мерами безопасности ASL-3
2025-05-22 Claude Opus 4 74.9% Anthropic представляет Claude Opus 4 и Sonnet 4 с расширенным мышлением и использованием инструментов
2025-04-16 OpenAI o3 87.7% OpenAI
2025-04-15 Gemini 2.0 Flash 60.1% Google выпустила Gemini 2.0 Flash с улучшенным качеством и двукратной скоростью по сравнению с Gemini 1.5 Pro
2025-04-14 GPT‑4.1 nano 50.3% OpenAI запустила GPT-4.1, GPT-4.1 mini и GPT-4.1 nano в API
2025-04-10 Seed1.5-Thinking 77.3% Seed1.5-Thinking использует обучение с подкреплением для улучшения рассуждений
2025-04-05 Gemini 2.5 Pro 84.0% Google расширяет доступ к Gemini 2.5 Pro на фоне высоких результатов в бенчмарках
2025-03-26 Gemini 2.5 Pro 84.0% Google выпустила экспериментальную модель рассуждений Gemini 2.5 Pro с контекстом на 1 млн токенов
2025-03-25 Gemini 2.5 Pro (experimental) 84.0% Google DeepMind выпустила экспериментальную модель Gemini 2.5 Pro
2025-03-25 Gemini 2.5 Pro 84.0% Google DeepMind
2025-03-24 DeepSeek-V3-0324 68.4% DeepSeek-V3-0324 улучшает рассуждения, программирование и китайское письмо по сравнению с DeepSeek-V3
2025-03-11 Grok 3 84.6% xAI выпустила Grok 3 с глубоким рассуждением и контекстом на миллион токенов
2025-03-05 GPT-4.5 71.4% OpenAI выпустила GPT-4.5, свою самую большую модель, для ChatGPT Plus
2025-02-26 Claude 3.7 Sonnet 84.8% Сравнение бенчмарков Claude 3.7 Sonnet, o3-mini, R1 и Grok 3 Beta
2025-02-26 Grok 3 Beta 84.6% Сравнение бенчмарков Claude 3.7 Sonnet, o3-mini, R1 и Grok 3 Beta
2025-02-26 DeepSeek R1 71.5% Сравнение бенчмарков Claude 3.7 Sonnet, o3-mini, R1 и Grok 3 Beta
2025-02-26 OpenAI o3-mini 78.0% Сравнение бенчмарков Claude 3.7 Sonnet, o3-mini, R1 и Grok 3 Beta
2025-02-26 Claude 3.5 Sonnet 65.0% Сравнение бенчмарков Claude 3.7 Sonnet, o3-mini, R1 и Grok 3 Beta
2025-02-24 Claude 3.7 Sonnet 84.8% Anthropic выпустила Claude 3.7 Sonnet с динамическим управлением рассуждением
2025-02-19 Grok 3 (Think) 84.6% xAI выпускает Grok 3 Beta и агента DeepSearch
2024-12-20 o3 87.7% OpenAI выпустила модель o3 с высокой производительностью в рассуждениях и программировании
2024-11-28 QwQ-32B-Preview 65.2% Qwen выпустила QwQ-32B-Preview, экспериментальную модель рассуждений
2024-07-15 Qwen2-72B 37.9% Команда Qwen выпустила серию Qwen2 с моделями на 72B (плотными и MoE)
2024-07-15 Qwen2-72B 37.9% Технический отчет Qwen2 представляет плотные и MoE модели до 72B
2024-06-20 Claude 3.5 Sonnet 59.4% Anthropic выпустила дополнение к Claude 3.5 Sonnet с улучшенными показателями в задачах программирования и зрения
2024-06-20 Claude 3.5 Sonnet 59.4% Anthropic
2023-11-20 GPT-4 based baseline 39.0% GPQA: Набор вопросов и ответов для выпускников, устойчивый к поиску в Google