| 2026-09-11 |
GPT-6 Astra |
96.3% |
OpenAI запускает GPT-6 Astra, занимая верхние позиции в рейтингах при снижении стоимости
|
| 2026-09-10 |
DeepSeek-V4.1-Flash |
90.9% |
DeepSeek выпустила модель V4.1-Flash с нативной мультимодальной поддержкой
|
| 2026-09-07 |
K2-Horizon-375B-A23B |
87.3% |
IFM выпускает K2 Horizon: шесть моделей с лицензией Apache 2.0 от 0,9B до 375B
|
| 2026-08-28 |
GLM-5.3 |
91.72% |
Z.ai доработала GLM-5.3 для повышения кибербезопасности
|
| 2026-08-25 |
QAH model (GPT-OSS 120B compressed to 60B, MXFP4) |
67.4% |
QAH от Multiverse Computing позволяет 4-битной модели GPT-OSS превзойти её полнопрецизионный оригинал
|
| 2026-08-21 |
Grok 4.6 |
94.9% |
SpaceXAI представляет Grok 4.6 с данными Cursor для агентных задач
|
| 2026-08-03 |
Qwen3.8-Max |
92.6% |
Alibaba выпустила Qwen3.8-Max — MoE-модель с 2,4 трлн параметров
|
| 2026-08-03 |
Inkling-Small |
89.5% |
Thinking Machines Lab выпустила Inkling-Small: открытую мультимодальную MoE-модель с 276B весов
|
| 2026-07-17 |
Kimi K3 |
93.5% |
Moonshot AI выпустила открытую модель Kimi K3 с 2,8 трлн параметров и контекстом в 1 млн токенов
|
| 2026-07-17 |
GPT-Live-1 |
84.2% |
OpenAI выпустила полнодуплексные голосовые модели, а немецкий суд признал Google ответственным за ИИ-обзоры
|
| 2026-03-25 |
o3 |
87.7% |
OpenAI объявляет о выводе o3 из ChatGPT и публикует результаты бенчмарков
|
| 2026-02-25 |
Grok 4 |
87.7% |
xAI выпустила модель рассуждений Grok 4 с сильными результатами в агентных и кодовых тестах
|
| 2026-02-05 |
Claude Opus 4.6 |
91.3% |
Anthropic выпустила Claude Opus 4.6 с контекстным окном на 1M токенов и улучшениями для агентов
|
| 2026-01-27 |
Kimi K2.5 |
87.6% |
Moonshot выпустила Kimi K2.5 с технологией Agent Swarm
|
| 2025-12-11 |
GPT-5.2 Thinking |
92.4% |
OpenAI выпустила модели GPT-5.2 Pro и Thinking для науки и математики
|
| 2025-12-11 |
GPT-5.2 Pro |
93.2% |
OpenAI представляет GPT-5.2 с улучшенными возможностями программирования, работы с длинным контекстом и рассуждений
|
| 2025-12-11 |
GPT-5.2 Pro |
93.2% |
OpenAI выпустила модели GPT-5.2 Pro и Thinking для науки и математики
|
| 2025-12-11 |
GPT-5.2 Thinking |
92.4% |
OpenAI представляет GPT-5.2 с улучшенными возможностями программирования, работы с длинным контекстом и рассуждений
|
| 2025-12-04 |
Gemini 3 Pro |
93.0% |
Epoch AI запускает Центр передовых дата-центров и анализирует бенчмарк OSWorld
|
| 2025-11-18 |
Gemini 3 Deep Think |
93.8% |
Google выпустила Gemini 3 Pro с передовыми возможностями рассуждения и мультимодальности
|
| 2025-11-18 |
Gemini 3 Deep Think |
93.8% |
Google выпустила Gemini 3 Pro с передовыми возможностями рассуждения и мультимодальности
|
| 2025-11-18 |
Gemini 3 Pro |
91.9% |
Google выпустила Gemini 3 Pro с передовыми возможностями рассуждения и мультимодальности
|
| 2025-11-18 |
Gemini 3 Pro |
91.9% |
Google выпустила Gemini 3 Pro с передовыми возможностями рассуждения и мультимодальности
|
| 2025-10-24 |
O1 |
77.0% |
Бенчмарк GPQA-Diamond: результаты, таблица лидеров и сравнение моделей ИИ
|
| 2025-10-24 |
Claude Opus 4.6 |
91.3% |
Бенчмарк GPQA-Diamond: результаты, таблица лидеров и сравнение моделей ИИ
|
| 2025-10-24 |
GPT-5.2 |
92.4% |
Бенчмарк GPQA-Diamond: результаты, таблица лидеров и сравнение моделей ИИ
|
| 2025-10-24 |
Gemini 3 Pro |
91.9% |
Бенчмарк GPQA-Diamond: результаты, таблица лидеров и сравнение моделей ИИ
|
| 2025-10-24 |
Aristotle-X1 |
92.4% |
Бенчмарк GPQA-Diamond: результаты, таблица лидеров и сравнение моделей ИИ
|
| 2025-10-24 |
Gemini 3.1 Pro Preview |
94.1% |
Бенчмарк GPQA-Diamond: результаты, таблица лидеров и сравнение моделей ИИ
|
| 2025-10-24 |
GPT-4 |
39.0% |
Бенчмарк GPQA-Diamond: результаты, таблица лидеров и сравнение моделей ИИ
|
| 2025-10-24 |
Claude 3 Opus |
60.0% |
Бенчмарк GPQA-Diamond: результаты, таблица лидеров и сравнение моделей ИИ
|
| 2025-09-30 |
Claude Sonnet 4.5 |
83.4% |
Anthropic выпустила Claude Sonnet 4.5 с улучшенными возможностями программирования и агентов
|
| 2025-09-22 |
DeepSeek-V3.1-Terminus |
74.24% |
DeepSeek выпустила DeepSeek-V3.1-Terminus с исправлениями языка и агентов
|
| 2025-08-07 |
GPT-5 pro |
89.4% |
OpenAI запускает унифицированную GPT-5 с маршрутизацией в реальном времени и бесплатным доступом
|
| 2025-08-07 |
GPT-5 pro |
88.4% |
OpenAI представляет GPT-5 с единым маршрутизатором и рассуждениями экспертного уровня
|
| 2025-08-07 |
GPT-5 Pro |
88.4% |
OpenAI запускает GPT-5 с адаптивным рассуждением и единой архитектурой
|
| 2025-07-28 |
Kimi K2 |
75.1% |
Kimi K2: открытая MoE-модель с 1T параметров и оптимизатором MuonClip
|
| 2025-07-28 |
Kimi K2 |
75.1% |
Moonshot выпустила Kimi K2, открытую агентную MoE-модель с 32B активных параметров
|
| 2025-05-30 |
Deepseek-R1-0528 |
81.0% |
DeepSeek обновляет модель R1 с улучшенными способностями к рассуждению и результатами на бенчмарках
|
| 2025-05-22 |
Claude Opus 4 |
74.9% |
Anthropic выпустила Claude Opus 4 и Sonnet 4 с мерами безопасности ASL-3
|
| 2025-05-22 |
Claude Opus 4 |
74.9% |
Anthropic представляет Claude Opus 4 и Sonnet 4 с расширенным мышлением и использованием инструментов
|
| 2025-05-22 |
Claude Sonnet 4 |
70.0% |
Anthropic представляет Claude Opus 4 и Sonnet 4 с расширенным мышлением и использованием инструментов
|
| 2025-04-16 |
OpenAI o3 |
87.7% |
OpenAI
|
| 2025-04-15 |
Gemini 2.0 Flash |
60.1% |
Google выпустила Gemini 2.0 Flash с улучшенным качеством и двукратной скоростью по сравнению с Gemini 1.5 Pro
|
| 2025-04-14 |
GPT‑4.1 nano |
50.3% |
OpenAI запустила GPT-4.1, GPT-4.1 mini и GPT-4.1 nano в API
|
| 2025-04-10 |
Seed1.5-Thinking |
77.3% |
Seed1.5-Thinking использует обучение с подкреплением для улучшения рассуждений
|
| 2025-04-05 |
Gemini 2.5 Pro |
84.0% |
Google расширяет доступ к Gemini 2.5 Pro на фоне высоких результатов в бенчмарках
|
| 2025-03-26 |
Gemini 2.5 Pro |
84.0% |
Google выпустила экспериментальную модель рассуждений Gemini 2.5 Pro с контекстом на 1 млн токенов
|
| 2025-03-25 |
Gemini 2.5 Pro (experimental) |
84.0% |
Google DeepMind выпустила экспериментальную модель Gemini 2.5 Pro
|
| 2025-03-25 |
Gemini 2.5 Pro |
84.0% |
Google DeepMind
|
| 2025-03-24 |
DeepSeek-V3-0324 |
68.4% |
DeepSeek-V3-0324 улучшает рассуждения, программирование и китайское письмо по сравнению с DeepSeek-V3
|
| 2025-03-11 |
Grok 3 |
84.6% |
xAI выпустила Grok 3 с глубоким рассуждением и контекстом на миллион токенов
|
| 2025-03-05 |
GPT-4.5 |
71.4% |
OpenAI выпустила GPT-4.5, свою самую большую модель, для ChatGPT Plus
|
| 2025-02-26 |
Claude 3.5 Sonnet |
65.0% |
Сравнение бенчмарков Claude 3.7 Sonnet, o3-mini, R1 и Grok 3 Beta
|
| 2025-02-26 |
Claude 3.7 Sonnet |
84.8% |
Сравнение бенчмарков Claude 3.7 Sonnet, o3-mini, R1 и Grok 3 Beta
|
| 2025-02-26 |
Grok 3 Beta |
84.6% |
Сравнение бенчмарков Claude 3.7 Sonnet, o3-mini, R1 и Grok 3 Beta
|
| 2025-02-26 |
DeepSeek R1 |
71.5% |
Сравнение бенчмарков Claude 3.7 Sonnet, o3-mini, R1 и Grok 3 Beta
|
| 2025-02-26 |
OpenAI o3-mini |
78.0% |
Сравнение бенчмарков Claude 3.7 Sonnet, o3-mini, R1 и Grok 3 Beta
|
| 2025-02-24 |
Claude 3.7 Sonnet |
84.8% |
Anthropic выпустила Claude 3.7 Sonnet с динамическим управлением рассуждением
|
| 2025-02-19 |
Grok 3 (Think) |
84.6% |
xAI выпускает Grok 3 Beta и агента DeepSearch
|
| 2024-12-20 |
o3 |
87.7% |
OpenAI выпустила модель o3 с высокой производительностью в рассуждениях и программировании
|
| 2024-11-28 |
QwQ-32B-Preview |
65.2% |
Qwen выпустила QwQ-32B-Preview, экспериментальную модель рассуждений
|
| 2024-07-15 |
Qwen2-72B |
37.9% |
Команда Qwen выпустила серию Qwen2 с моделями на 72B (плотными и MoE)
|
| 2024-07-15 |
Qwen2-72B |
37.9% |
Технический отчет Qwen2 представляет плотные и MoE модели до 72B
|
| 2024-06-20 |
Claude 3.5 Sonnet |
59.4% |
Anthropic выпустила дополнение к Claude 3.5 Sonnet с улучшенными показателями в задачах программирования и зрения
|
| 2024-06-20 |
Claude 3.5 Sonnet |
59.4% |
Anthropic
|
| 2023-11-20 |
GPT-4 based baseline |
39.0% |
GPQA: Набор вопросов и ответов для выпускников, устойчивый к поиску в Google
|