Бенчмарк · coding

Codeforces (Elo)

10 результатов 10 моделей

Codeforces (Elo) измеряет способность модели в спортивном программировании: она решает конкурсные задачи на время, а результат выражается рейтингом Codeforces Elo (примерно 0–4000, где около 2000+ — это сильный уровень).

Подробнее
Пример
Типичное задание — алгоритмическая задача на время: например, прочитать входные данные и вывести правильный ответ в пределах строгих ограничений по времени и памяти, применяя приёмы вроде обхода графа, динамического программирования или жадных алгоритмов.
Метрика
Результат — одно число Elo, вычисляемое из того, сколько конкурсных задач решила модель и насколько они сложные, и размещённое на той же рейтинговой шкале, которую Codeforces использует для живых участников.
Приёмка
Каждое присланное решение проверяется автоматически: код компилируется и запускается на скрытом наборе тестов и засчитывается как решённое, только если выдаёт правильный вывод в пределах ограничений по времени и памяти.
Почему важно
Он отражает многошаговое алгоритмическое мышление и умение писать корректный, эффективный код в рамках ограничений, а также переносит навыки программирования модели на понятную людям рейтинговую шкалу.
Разбор примера
Задача
Watermelon: дано целое число w (1 ≤ w ≤ 100) — вес арбуза; определите, можно ли разделить его на две части так, чтобы каждая весила положительное чётное число килограммов. Выведите «YES» или «NO».
Решение
w = int(input())
print("YES" if w > 2 and w % 2 == 0 else "NO")
Разбор
Сумма двух положительных чётных чисел сама чётна и не меньше 4, поэтому корректное разбиение существует ровно тогда, когда w чётно и w > 2 (например, w=8 → 2+6). Codeforces оценивает решение, компилируя его и запуская на скрытых тестах, требуя точный вывод в stdout в пределах ограничений по времени и памяти.
88 1016 1944 2872 3800 2024-09-12 2025-08-14 2026-07-16 o1 · 1807 · 2024-09-12 OpenAI o1-preview · 89 · 2024-10-01 o3 · 2727 · 2024-12-20 QwQ-32B-Preview · 1261 · 2025-01-02 o1-mini · 1578 · 2025-01-02 DeepSeek-R1 · 2029 · 2025-01-22 o4-mini · 2719 · 2025-04-17 Qwen3-235B-A22B · 2056 · 2025-05-14 Gemini 3 Deep Think · 3455 · 2026-02-12 GFlowRL · 2048 · 2026-07-16
o1 OpenAI o1-preview o3 QwQ-32B-Preview o1-mini DeepSeek-R1 o4-mini Qwen3-235B-A22B Gemini 3 Deep Think GFlowRL
Хронология
Дата Модель Результат Источник
2026-07-16 GFlowRL 2048.0Elo Microsoft выпустила GFlowRL: стабильный RL в стиле GFlowNet для больших языковых моделей
2026-02-12 Gemini 3 Deep Think 3455.0Elo Google выпустила обновлённый Gemini 3 Deep Think с новыми результатами бенчмарков
2025-05-14 Qwen3-235B-A22B 2056.0Elo Qwen3 представляет единый режим рассуждений и поддержку 119 языков
2025-04-17 o4-mini 2719.0Elo OpenAI выпустила o4-mini: более быструю и дешёвую мультимодальную модель рассуждений
2025-01-22 DeepSeek-R1 2029.0Elo DeepSeek выпускает модели рассуждений R1 с помощью обучения с подкреплением
2025-01-02 QwQ-32B-Preview 1261.0Elo CodeElo представляет бенчмарк генерации кода соревновательного уровня с рейтингами Эло, сопоставимыми с человеческими
2025-01-02 o1-mini 1578.0Elo CodeElo представляет бенчмарк генерации кода соревновательного уровня с рейтингами Эло, сопоставимыми с человеческими
2024-12-20 o3 2727.0Elo OpenAI выпустила модель o3 с высокой производительностью в рассуждениях и программировании
2024-10-01 OpenAI o1-preview 89.0Elo Сравнение OpenAI o1 с другими ведущими моделями
2024-09-12 o1 1807.0Elo OpenAI выпустила o1-preview, модель рассуждений, превосходящую экспертов-людей на тестах по математике и науке