| 2026-09-09 |
Qwen Test agent + Repair agent (post-trained) |
72.6% |
ExecCritic использует специфичное для роли обучение с подкреплением для улучшения кодогенерирующих агентов посредством ремонта, направляемого тестами
|
| 2026-09-09 |
Qwen Test agent (post-trained) |
62.2% |
ExecCritic использует специфичное для роли обучение с подкреплением для улучшения кодогенерирующих агентов посредством ремонта, направляемого тестами
|
| 2026-09-09 |
GPT-5.6-sol (Test agent) |
65.3% |
ExecCritic использует специфичное для роли обучение с подкреплением для улучшения кодогенерирующих агентов посредством ремонта, направляемого тестами
|
| 2026-09-09 |
base Test agent (no-test baseline) |
57.3% |
ExecCritic использует специфичное для роли обучение с подкреплением для улучшения кодогенерирующих агентов посредством ремонта, направляемого тестами
|
| 2026-09-09 |
base Repair agent (no-test baseline) |
61.2% |
ExecCritic использует специфичное для роли обучение с подкреплением для улучшения кодогенерирующих агентов посредством ремонта, направляемого тестами
|
| 2026-09-09 |
Qwen Test agent (post-trained) + Repair agent (post-trained) |
72.6% |
ExecCritic использует ролевое RL для улучшения кодогенерирующих агентов через тест-ориентированное исправление
|
| 2026-09-09 |
Qwen Test agent (post-trained) |
62.2% |
ExecCritic использует ролевое RL для улучшения кодогенерирующих агентов через тест-ориентированное исправление
|
| 2026-09-09 |
GPT-5.6-sol (Test agent) |
65.3% |
ExecCritic использует ролевое RL для улучшения кодогенерирующих агентов через тест-ориентированное исправление
|
| 2026-09-09 |
base Repair agent (no-test baseline) |
61.2% |
ExecCritic использует ролевое RL для улучшения кодогенерирующих агентов через тест-ориентированное исправление
|
| 2026-09-09 |
base Test agent |
57.3% |
ExecCritic использует ролевое RL для улучшения кодогенерирующих агентов через тест-ориентированное исправление
|
| 2026-09-07 |
K2-Horizon-7B |
70.6% |
IFM выпускает K2 Horizon: шесть моделей с лицензией Apache 2.0 от 0,9B до 375B
|
| 2026-09-07 |
K2-Horizon-3.7B |
68.6% |
IFM выпускает K2 Horizon: шесть моделей с лицензией Apache 2.0 от 0,9B до 375B
|
| 2026-09-02 |
Qwen3.5-9B |
16.6% |
CANOPY позволяет Qwen3-14B занять первое место в AppWorld с помощью RL только по результату
|
| 2026-08-26 |
Granite 4.2 30B |
57.0% |
IBM выпустила Granite 4.2 с нативным рассуждением и агентным RL для открытых корпоративных моделей
|
| 2026-08-26 |
Granite 4.2 8B |
47.67% |
IBM выпустила Granite 4.2 с нативным рассуждением и агентным RL для открытых корпоративных моделей
|
| 2026-08-20 |
Qwen3.5-9B |
14.6% |
Meta выпустила Muse Video с нативным аудио; Stripe приобрела OpenRouter
|
| 2026-08-20 |
Ornith-1.5 |
86.0% |
Z.ai предлагает закон масштабирования после дообучения и выпускает GLM 5.3; Ornith-1.5 выходит с функцией самосовершенствования
|
| 2026-08-19 |
Ornith-1.5 |
86.0% |
Ornith-1.5 выпускает модели 9B, 35B-A3B и 397B с самосовершенствующимся обучением
|
| 2026-08-18 |
Qwen3.5-27B |
74.8% |
Агент Kozuchi решает 374 задачи из SWE-bench Verified с помощью Qwen3.5-27B
|
| 2026-08-10 |
Qwen3.6-27B |
77.2% |
Meta выпустила Muse Glimmer — 30-миллиардную агентную модель с открытыми весами, работающую на одном потребительском GPU
|
| 2026-08-03 |
Orchard-SWE |
69.7% |
Microsoft Research выпускает фреймворк Orchard для масштабируемого агентного ИИ
|
| 2026-08-03 |
Inkling-Small |
80.2% |
Thinking Machines Lab выпустила Inkling-Small: открытую мультимодальную MoE-модель с 276B весов
|
| 2026-07-24 |
Claude Opus 5 |
96.0% |
Anthropic выпустила Claude Opus 5 с включённым по умолчанию режимом размышлений и улучшениями в агентном программировании
|
| 2026-07-19 |
DeepSeek V4 Pro |
80.6% |
Сравнение Kimi K3, DeepSeek V4 Pro и GLM-5.2 по бенчмаркам, лицензии и стоимости обслуживания
|
| 2026-07-17 |
Devstral Small 2 |
68.0% |
Mistral Vibe for Code лидирует среди четырёх кодовых агентов в задаче от каркаса до PR
|
| 2026-07-17 |
Devstral 2 |
72.2% |
Mistral Vibe for Code лидирует среди четырёх кодовых агентов в задаче от каркаса до PR
|
| 2026-07-14 |
Qwen3-30B-A3B |
6.0% |
UMoE переупорядочивает пулы экспертов MoE для улучшенного доменно-специфичного тонкого настройки
|
| 2026-07-14 |
Qwen3.5-35B-A3B |
6.0% |
UMoE переупорядочивает пулы экспертов MoE для улучшенного доменно-специфичного тонкого настройки
|
| 2026-07-07 |
LLM-as-a-Verifier |
78.2% |
LLM-as-a-Verifier представляет общую систему верификации с непрерывным оцениванием
|
| 2026-06-17 |
LoopCoder-V2 |
64.4% |
LoopCoder-V2: Модель PLT с двумя циклами достигает наилучшего соотношения выгоды и затрат
|
| 2026-06-17 |
LoopCoder-v2 |
64.4% |
LoopCoder-v2 достигает оптимальной производительности при двух циклах
|
| 2026-04-25 |
Qwen3.6-27B |
77.2% |
Alibaba выпустила Qwen3.6-27B, превосходящую более крупного предшественника на бенчмарках по программированию
|
| 2026-04-24 |
V4-Pro-Max |
80.6% |
DeepSeek выпустила V4 с эффективной архитектурой длинного контекста для агентов
|
| 2026-03-25 |
o3 |
71.7% |
OpenAI объявляет о выводе o3 из ChatGPT и публикует результаты бенчмарков
|
| 2026-02-17 |
Claude Sonnet 4.6 |
79.6% |
Anthropic выпустила Claude Sonnet 4.6 с улучшенным программированием, управлением компьютером и контекстом на 1 млн токенов
|
| 2026-02-05 |
Claude Opus 4.6 |
80.8% |
Anthropic выпустила Claude Opus 4.6 с контекстным окном на 1M токенов и улучшениями для агентов
|
| 2026-02-01 |
MiniMax M2.5 |
80.2% |
Очищенные бенчмарки выявляют разрыв в 12 пунктов между ведущими ИИ-моделями для кодинга
|
| 2026-02-01 |
Claude Opus 4.6 |
80.8% |
Очищенные бенчмарки выявляют разрыв в 12 пунктов между ведущими ИИ-моделями для кодинга
|
| 2026-01-28 |
Qwen3.6-27B |
77.2% |
Qwen 3.6-27B и DeepSeek V4 Flash лидируют в локальных бенчмарках для программирования
|
| 2025-12-11 |
GPT-5.2 Thinking |
80.0% |
OpenAI выпустила GPT-5.2, превосходящую Gemini 3 в тестах по программированию и рассуждению
|
| 2025-12-11 |
GPT-5.2 Thinking |
80.0% |
OpenAI представляет GPT-5.2 с передовыми возможностями для профессиональной интеллектуальной работы
|
| 2025-12-09 |
Devstral Small 2 |
68.0% |
Mistral выпускает модели для разработки Devstral 2 и Mistral Vibe CLI
|
| 2025-12-09 |
Devstral 2 |
72.2% |
Mistral выпускает модели для разработки Devstral 2 и Mistral Vibe CLI
|
| 2025-11-19 |
Kimi K2 Thinking |
71.3% |
Moonshot AI выпустила Kimi K2 Thinking с агентным использованием инструментов
|
| 2025-11-19 |
GPT-5.1-Codex-Max |
77.9% |
OpenAI делает GPT-5.1-Codex-Max моделью по умолчанию в Codex CLI
|
| 2025-11-07 |
Kimi K2 Thinking |
71.3% |
Moonshot AI выпустила Kimi K2 Thinking, открытую модель рассуждений на 1 трлн параметров
|
| 2025-09-30 |
Claude Sonnet 4.5 |
77.2% |
Anthropic выпустила Claude Sonnet 4.5 с улучшенными возможностями программирования и агентов
|
| 2025-09-29 |
Claude Sonnet 4.5 |
77.2% |
Anthropic
|
| 2025-08-07 |
GPT-5 |
74.9% |
OpenAI запускает унифицированную GPT-5 с маршрутизацией в реальном времени и бесплатным доступом
|
| 2025-08-07 |
GPT-5 |
74.9% |
OpenAI представляет GPT-5 с единым маршрутизатором и рассуждениями экспертного уровня
|
| 2025-08-07 |
GPT‑5 |
74.9% |
OpenAI выпустила API GPT-5 с улучшениями для кодинга и агентов
|
| 2025-08-07 |
GPT-5 |
74.9% |
OpenAI запускает GPT-5 с адаптивным рассуждением и единой архитектурой
|
| 2025-08-07 |
GPT-5 |
74.9% |
OpenAI
|
| 2025-08-06 |
GLM-4.5 |
64.2% |
Zhipu AI выпустила модели GLM-4.5, сопоставимые с Claude и DeepSeek
|
| 2025-07-28 |
Kimi K2 |
65.8% |
Kimi K2: открытая MoE-модель с 1T параметров и оптимизатором MuonClip
|
| 2025-07-28 |
Kimi K2 |
65.8% |
Moonshot выпустила Kimi K2, открытую агентную MoE-модель с 32B активных параметров
|
| 2025-07-11 |
Kimi K2-Instruct |
65.8% |
Moonshot AI выпустила Kimi-K2-Instruct, MoE-модель на 1 трлн параметров с агентными возможностями
|
| 2025-07-11 |
Kimi K2 |
65.8% |
Moonshot AI выпустила Kimi K2: MoE-модель с 1 трлн параметров и агентными возможностями
|
| 2025-07-10 |
Devstral Small 1.1 |
53.6% |
Mistral AI выпускает Devstral Small 1.1 и Devstral Medium вместе с All Hands AI
|
| 2025-07-10 |
Devstral Medium |
61.6% |
Mistral AI выпускает Devstral Small 1.1 и Devstral Medium вместе с All Hands AI
|
| 2025-05-30 |
Deepseek-R1-0528 |
57.6% |
DeepSeek обновляет модель R1 с улучшенными способностями к рассуждению и результатами на бенчмарках
|
| 2025-05-23 |
Claude Opus 4 |
72.5% |
Anthropic выпустила Claude Opus 4 и Sonnet 4 с гибридным рассуждением
|
| 2025-05-23 |
Claude Sonnet 4 |
72.7% |
Anthropic выпустила Claude Opus 4 и Sonnet 4 с гибридным рассуждением
|
| 2025-05-22 |
Claude Opus 4 |
72.5% |
Anthropic
|
| 2025-05-21 |
Devstral |
46.8% |
Mistral AI выпустила агентную LLM Devstral для разработки программного обеспечения
|
| 2025-04-17 |
o4-mini |
68.1% |
OpenAI выпустила o4-mini: более быструю и дешёвую мультимодальную модель рассуждений
|
| 2025-04-16 |
OpenAI o3 |
71.7% |
OpenAI
|
| 2025-04-14 |
GPT‑4.1 |
54.6% |
OpenAI запустила GPT-4.1, GPT-4.1 mini и GPT-4.1 nano в API
|
| 2025-04-14 |
GPT-4.1 |
54.6% |
OpenAI выпустила семейство GPT-4.1 с контекстом на 1 млн токенов и улучшениями для программирования
|
| 2025-03-26 |
Gemini 2.5 Pro |
63.8% |
Google выпустила экспериментальную модель рассуждений Gemini 2.5 Pro с контекстом на 1 млн токенов
|
| 2025-03-25 |
Gemini 2.5 Pro |
63.8% |
Google представляет модель мышления Gemini 2.5 Pro
|
| 2025-03-25 |
Gemini 2.5 Pro |
63.8% |
Google представляет экспериментальную модель Gemini 2.5 Pro
|
| 2025-03-25 |
Gemini 2.5 Pro |
63.8% |
Google DeepMind
|
| 2025-03-05 |
GPT-4.5 |
38.0% |
OpenAI выпустила GPT-4.5, свою самую большую модель, для ChatGPT Plus
|
| 2025-02-24 |
Claude 3.7 Sonnet |
62.3% |
Anthropic
|
| 2025-01-06 |
Claude 3.5 Sonnet |
49.0% |
Claude 3.5 Sonnet достигает 49% на SWE-bench Verified
|
| 2024-12-20 |
o3 |
71.7% |
OpenAI демонстрирует модель рассуждений o3 с прорывами в ARC AGI и Frontier Math
|
| 2024-12-20 |
o3 |
71.7% |
OpenAI выпустила модель o3 с высокой производительностью в рассуждениях и программировании
|
| 2024-10-30 |
Claude 3.5 Sonnet |
49.0% |
Claude 3.5 Sonnet достигает 49% на SWE-bench Verified при минимальном агентном каркасе
|
| 2024-10-22 |
Claude 3.5 Haiku |
40.6% |
Anthropic обновляет Claude 3.5 Sonnet, выпускает Claude 3.5 Haiku и бета-версию функции «computer use»
|
| 2024-10-22 |
Claude 3.5 Sonnet |
49.0% |
Anthropic обновляет Claude 3.5 Sonnet, выпускает Claude 3.5 Haiku и бета-версию функции «computer use»
|
| 2024-10-22 |
Claude 3.5 Sonnet |
49.0% |
Anthropic
|
| 2024-08-13 |
Agentless |
32.0% |
OpenAI выпустила SWE-bench Verified с проверенной человеком выборкой
|
| 2024-08-13 |
GPT‑4o |
33.2% |
OpenAI выпустила SWE-bench Verified с проверенной человеком выборкой
|