Бенчмарк · coding

LiveCodeBench

20 результатов 18 моделей

LiveCodeBench оценивает, насколько хорошо большие языковые модели решают задачи competitive programming, используя задания, которые непрерывно собираются с недавних соревнований, чтобы избежать загрязнения обучающими данными. Ключевая метрика — pass@1, доля задач, решённых правильно с первой попытки модели.

Подробнее
Пример
Типичный элемент — задача в стиле программистского соревнования: например, по массиву целых чисел написать функцию, возвращающую длину наибольшей строго возрастающей подпоследовательности, — которую модель должна решить, сгенерировав работающий код.
Метрика
Каждое сгенерированное решение запускается на тестах задачи; pass@1 — это доля задач, для которых первая отправка модели проходит все тесты.
Приёмка
Решение принимается автоматически, когда сгенерированный код проходит все скрытые и открытые тесты этой задачи — ни ручной оценки, ни точного совпадения текста не требуется.
Почему важно
Поскольку задачи берутся из соревнований, вышедших уже после окончания обучения модели, LiveCodeBench измеряет настоящее умение рассуждать и писать код, а не заученные ответы, что делает его надёжным и устойчивым к загрязнению показателем навыков программирования.
Разбор примера
Задача
Стиль спортивного программирования (stdin/stdout). Даны n целых чисел; посчитайте количество пар (i, j) с i < j, для которых nums[i] + nums[j] чётно. Ввод: в первой строке n, во второй — n целых чисел через пробел; выведите количество.
Решение
import sys

def main():
    data = sys.stdin.read().split()
    n = int(data[0])
    nums = list(map(int, data[1:1 + n]))
    odd = sum(x % 2 for x in nums)
    even = n - odd
    print(odd * (odd - 1) // 2 + even * (even - 1) // 2)

main()
Разбор
Сумма чётна тогда и только тогда, когда оба слагаемых одной чётности, поэтому ответ равен C(evens, 2) + C(odds, 2); подсчёт чётностей выполняется за O(n). LiveCodeBench запускает программу модели на скрытых юнит-тестах и оценивает её по pass@1 — засчитывается, только если проходят все тесты.
0 23 46 69 92 2024-07-15 2025-07-07 2026-06-30 Qwen2-72B-Instruct · 35.7 · 2024-07-15 Qwen2-72B-Instruct · 35.7 · 2024-07-15 QwQ-32B-Preview · 50 · 2024-11-28 DeepSeek-R1-Distill-Qwen-32B · 57.2 · 2025-01-22 Kimi k1.5 (short-CoT) · 47.3 · 2025-01-22 Grok 3 (Think) · 79.4 · 2025-02-19 Grok 3 mini · 80.4 · 2025-02-19 Grok 3 · 79.4 · 2025-03-11 DeepSeek-V3-0324 · 49.2 · 2025-03-24 Gemini 2.5 Pro · 70.4 · 2025-03-26 Gemini 2.0 Flash · 34.5 · 2025-04-15 Qwen3-235B-A22B · 70.7 · 2025-05-14 Deepseek-R1-0528 · 73.3 · 2025-05-30 Kimi K2 · 53.7 · 2025-07-28 Kimi K2 · 53.7 · 2025-07-28 GLM-4.6 · 82.8 · 2025-09-30 Kimi K2 Thinking · 83.1 · 2025-11-07 Step 3.5 Flash · 86.4 · 2026-02-10 Grok 4 · 81.9 · 2026-02-25 Agents-A1 · 44.3 · 2026-06-30
Qwen2-72B-Instruct QwQ-32B-Preview DeepSeek-R1-Distill-Qwen-32B Kimi k1.5 (short-CoT) Grok 3 (Think) Grok 3 mini Grok 3 DeepSeek-V3-0324 Gemini 2.5 Pro Gemini 2.0 Flash Qwen3-235B-A22B Deepseek-R1-0528 Kimi K2 GLM-4.6 Kimi K2 Thinking Step 3.5 Flash Grok 4 Agents-A1
Хронология
Дата Модель Результат Источник
2026-06-30 Agents-A1 44.3pts Масштабирование горизонта, а не параметров: достижение производительности триллионных моделей с агентом на 35B
2026-02-25 Grok 4 81.9% xAI выпустила модель рассуждений Grok 4 с сильными результатами в агентных и кодовых тестах
2026-02-10 Step 3.5 Flash 86.4% Шаг 3.5 Flash: открытая MoE-модель с 11B активных параметров достигает уровня передовых агентов
2025-11-07 Kimi K2 Thinking 83.1% Moonshot AI выпустила Kimi K2 Thinking, открытую модель рассуждений на 1 трлн параметров
2025-09-30 GLM-4.6 82.8% Zhipu AI выпустила GLM-4.6 с агентными возможностями и контекстным окном на 128k токенов
2025-07-28 Kimi K2 53.7% Kimi K2: открытая MoE-модель с 1T параметров и оптимизатором MuonClip
2025-07-28 Kimi K2 53.7% Moonshot выпустила Kimi K2, открытую агентную MoE-модель с 32B активных параметров
2025-05-30 Deepseek-R1-0528 73.3% DeepSeek обновляет модель R1 с улучшенными способностями к рассуждению и результатами на бенчмарках
2025-05-14 Qwen3-235B-A22B 70.7% Qwen3 представляет единый режим рассуждений и поддержку 119 языков
2025-04-15 Gemini 2.0 Flash 34.5% Google выпустила Gemini 2.0 Flash с улучшенным качеством и двукратной скоростью по сравнению с Gemini 1.5 Pro
2025-03-26 Gemini 2.5 Pro 70.4% Google выпустила экспериментальную модель рассуждений Gemini 2.5 Pro с контекстом на 1 млн токенов
2025-03-24 DeepSeek-V3-0324 49.2% DeepSeek-V3-0324 улучшает рассуждения, программирование и китайское письмо по сравнению с DeepSeek-V3
2025-03-11 Grok 3 79.4% xAI выпустила Grok 3 с глубоким рассуждением и контекстом на миллион токенов
2025-02-19 Grok 3 (Think) 79.4% xAI выпускает Grok 3 Beta и агента DeepSearch
2025-02-19 Grok 3 mini 80.4% xAI выпускает Grok 3 Beta и агента DeepSearch
2025-01-22 DeepSeek-R1-Distill-Qwen-32B 57.2% DeepSeek выпускает модели рассуждений R1 с помощью обучения с подкреплением
2025-01-22 Kimi k1.5 (short-CoT) 47.3% Kimi k1.5 масштабирует обучение с подкреплением на основе LLM для достижения уровня o1 и превосходства над моделями с коротким цепочечным мышлением
2024-11-28 QwQ-32B-Preview 50.0% Qwen выпустила QwQ-32B-Preview, экспериментальную модель рассуждений
2024-07-15 Qwen2-72B-Instruct 35.7% Команда Qwen выпустила серию Qwen2 с моделями на 72B (плотными и MoE)
2024-07-15 Qwen2-72B-Instruct 35.7% Технический отчет Qwen2 представляет плотные и MoE модели до 72B