| 2026-09-10 |
DeepSeek-V4.1-Flash |
90.6% |
DeepSeek выпустила модель V4.1-Flash с нативной мультимодальной поддержкой
|
| 2026-09-07 |
K2-Horizon-MoVA-36B-A4B |
58.6% |
IFM выпускает K2 Horizon: шесть моделей с лицензией Apache 2.0 от 0,9B до 375B
|
| 2026-09-07 |
K2-Horizon-375B-A23B |
66.9% |
IFM выпускает K2 Horizon: шесть моделей с лицензией Apache 2.0 от 0,9B до 375B
|
| 2026-09-04 |
Muse Spark 1.3 |
88.8% |
Meta выпустила Muse Spark 1.3 с меньшим числом вызовов инструментов и токенов
|
| 2026-08-26 |
Granite 4.2 30B |
29.24% |
IBM выпустила Granite 4.2 с нативным рассуждением и агентным RL для открытых корпоративных моделей
|
| 2026-08-26 |
Granite 4.2 8B |
20.56% |
IBM выпустила Granite 4.2 с нативным рассуждением и агентным RL для открытых корпоративных моделей
|
| 2026-08-21 |
Grok 4.6 |
88.4% |
SpaceXAI представляет Grok 4.6 с данными Cursor для агентных задач
|
| 2026-08-21 |
DeepSeek-V4-Flash-Vision-Exp |
83.9% |
DeepSeek выпустила мультимодальную модель DeepSeek-V4-Flash-Vision-Exp
|
| 2026-08-20 |
agents |
94.0% |
Meta выпустила Muse Video с нативным аудио; Stripe приобрела OpenRouter
|
| 2026-08-19 |
Ornith-1.5 |
86.1% |
Ornith-1.5 выпускает модели 9B, 35B-A3B и 397B с самосовершенствующимся обучением
|
| 2026-08-13 |
DeepSeek-V4-Pro |
87.9% |
GA-релиз DeepSeek-V4-Pro улучшает возможности агентов и добавляет поддержку API ответов
|
| 2026-08-13 |
Grok 4.6 |
88.4% |
xAI выпустила Grok 4.6; Alibaba открыла Qwen3.8-MoE; DeepSeek V4 Pro GA
|
| 2026-08-11 |
Opus 5 |
86.74% |
Саморазвивающийся агент Ouroboros устанавливает новые рекорды с Opus 5
|
| 2026-08-10 |
Qwen3.6-27B |
60.7% |
Meta выпустила Muse Glimmer — 30-миллиардную агентную модель с открытыми весами, работающую на одном потребительском GPU
|
| 2026-08-09 |
DeepSeek V4 Flash 0731 |
82.7% |
DeepSeek V4 Flash 0731 показал 82.7% на Terminal-Bench 2.1 в публичном стенде
|
| 2026-08-08 |
Pokee-Isaac 28B |
65.1% |
Pokee AI выпустила Pokee-Isaac 28B — модель с контекстом на 10M токенов для развёртывания в контролируемой среде
|
| 2026-08-07 |
DeepSeek-V4-Flash-0731 |
82.7% |
DeepSeek выпустила V4-Flash-0731, превосходящую V4-Pro при меньшей стоимости
|
| 2026-08-05 |
Muse Spark 1.1 |
80.0% |
Meta выпустила бета-версию терминального агента Muse Code на базе модели Muse Spark 1.2
|
| 2026-08-05 |
Qwen3.8-Max |
67.4% |
Alibaba анонсировала Qwen3.8-Max с 2,4 трлн параметров и скорым открытием весов
|
| 2026-08-03 |
Qwen3.8-Max |
86.6% |
Alibaba выпустила Qwen3.8-Max — MoE-модель с 2,4 трлн параметров
|
| 2026-08-03 |
Inkling-Small |
64.7% |
Thinking Machines Lab выпустила Inkling-Small: открытую мультимодальную MoE-модель с 276B весов
|
| 2026-08-01 |
V4 Flash 0731 |
79.0% |
DeepSeek выпустила V4-Flash с существенными улучшениями после дообучения и открытыми весами
|
| 2026-08-01 |
DeepSeek-V4-Flash |
79.0% |
DeepSeek выпустила V4-Flash с улучшениями после дообучения и открытыми весами
|
| 2026-07-31 |
DeepSeek-V4-Flash-0731 |
82.7% |
DeepSeek выпустила V4-Flash-0731 с существенными улучшениями агентных способностей при снижении стоимости
|
| 2026-07-31 |
DeepSeek-V4-Flash |
82.7% |
DeepSeek выпускает DeepSeek-V4-Flash в публичную бета-версию с улучшенными возможностями агента
|
| 2026-07-27 |
Gemini 3.5 Flash-Lite |
54.0% |
Google выпустила Gemini 3.6 Flash, 3.5 Flash-Lite и 3.5 Flash Cyber
|
| 2026-07-26 |
KAT-Coder-V2.5 |
60.7% |
KwaiKAT выпустила KAT-Coder-V2.5 — агентную модель для написания кода, обученную на 100 000+ проверяемых средах
|
| 2026-07-21 |
Gemini 3.5 Flash-Lite |
54.0% |
Google выпустила Gemini 3.6 Flash, 3.5 Flash-Lite и 3.5 Flash Cyber для агентных рабочих нагрузок
|
| 2026-07-21 |
Gemini 3.5 Flash-Lite |
54.0% |
Google выпустила Gemini 3.6 Flash, 3.5 Flash-Lite и 3.5 Flash Cyber
|
| 2026-07-08 |
hermes |
55.0% |
Пользователи сравнивают Mimo v2.5 с DeepSeek V4 Flash и Hermes
|
| 2026-07-08 |
Grok 4.5 |
83.3% |
xAI выпустила Grok 4.5 с низкой стоимостью и смешанными результатами бенчмарков
|
| 2026-07-07 |
LLM-as-a-Verifier |
86.5% |
LLM-as-a-Verifier представляет общую систему верификации с непрерывным оцениванием
|
| 2026-07-05 |
GLM 5.2 FP8 with FP8 KV |
79.8% |
GLM 5.2 FP8 с FP8 KV достигает 79,8% в Terminal-Bench 2.1
|
| 2026-06-23 |
Tmax-27B |
43.0% |
Агент Tmax-27B для малых видеокарт с обучением DPPO
|
| 2026-06-23 |
Tmax |
27.0% |
Tmax: Простая рецептура RL для агентов-конечных
|
| 2026-04-25 |
Qwen3.6-27B |
59.3% |
Alibaba выпустила Qwen3.6-27B, превосходящую более крупного предшественника на бенчмарках по программированию
|
| 2026-04-25 |
GPT-5.5 |
82.7% |
OpenAI выпустила GPT-5.5: модель с нуля переобученная для нативной омнимодальной обработки
|
| 2026-04-23 |
GPT-5.5 |
82.7% |
OpenAI выпустила GPT-5.5 с агентными возможностями и удвоенной ценой API
|
| 2026-04-23 |
GPT-5.5 |
82.7% |
OpenAI выпустила GPT-5.5 и GPT-5.5 Pro через API
|
| 2026-04-12 |
MiniMax M2.7 |
57.0% |
MiniMax открыл исходный код M2.7, самообучающейся модели MoE, показавшей 56.22% на SWE-Pro
|
| 2026-02-10 |
Step 3.5 Flash |
51.0% |
Шаг 3.5 Flash: открытая MoE-модель с 11B активных параметров достигает уровня передовых агентов
|
| 2025-11-19 |
GPT-5.1-Codex-Max |
58.1% |
OpenAI делает GPT-5.1-Codex-Max моделью по умолчанию в Codex CLI
|