Benchmark · coding

Codeforces (Elo)

10 resultados 10 modelos

Codeforces (Elo) mede a capacidade de um modelo em programação competitiva fazendo-o resolver problemas de competição com tempo limitado, expressa como uma pontuação Elo do Codeforces (aproximadamente 0–4000, onde cerca de 2000+ já é um nível forte).

Saiba mais
Exemplo
Um item típico é um problema algorítmico com tempo limitado — por exemplo, ler a entrada do problema e imprimir a resposta correta dentro de rígidos limites de tempo e memória, usando técnicas como busca em grafos, programação dinâmica ou algoritmos gulosos.
Pontuação
O resultado é um único número Elo calculado a partir de quantos problemas de competição o modelo resolve e de sua dificuldade, colocado na mesma escala de pontuação que o Codeforces usa para os competidores humanos.
Verificação
Cada solução enviada é avaliada automaticamente: o código é compilado e executado contra um conjunto oculto de casos de teste e só conta como resolvido se produzir a saída correta dentro dos limites de tempo e memória.
Por que importa
Ela reflete o raciocínio algorítmico de várias etapas e a capacidade de escrever código correto e eficiente sob restrições, e traduz a habilidade de programação de um modelo para uma escala de pontuação que as pessoas já entendem.
Exemplo resolvido
Tarefa
Watermelon: dado um inteiro w (1 ≤ w ≤ 100), o peso de uma melancia, determine se ela pode ser dividida em duas partes de modo que cada uma pese um número par positivo de quilogramas. Imprima «YES» ou «NO».
Solução
w = int(input())
print("YES" if w > 2 and w % 2 == 0 else "NO")
Explicação
A soma de dois inteiros pares positivos é par e no mínimo 4, então uma divisão válida existe exatamente quando w é par e w > 2 (por exemplo, w=8 → 2+6). O Codeforces avalia compilando a submissão e executando-a contra casos de teste ocultos, exigindo saída exata no stdout dentro dos limites de tempo e memória.
88 1016 1944 2872 3800 2024-09-12 2025-08-14 2026-07-16 o1 · 1807 · 2024-09-12 OpenAI o1-preview · 89 · 2024-10-01 o3 · 2727 · 2024-12-20 QwQ-32B-Preview · 1261 · 2025-01-02 o1-mini · 1578 · 2025-01-02 DeepSeek-R1 · 2029 · 2025-01-22 o4-mini · 2719 · 2025-04-17 Qwen3-235B-A22B · 2056 · 2025-05-14 Gemini 3 Deep Think · 3455 · 2026-02-12 GFlowRL · 2048 · 2026-07-16
o1 OpenAI o1-preview o3 QwQ-32B-Preview o1-mini DeepSeek-R1 o4-mini Qwen3-235B-A22B Gemini 3 Deep Think GFlowRL
Linha do tempo
Data Modelo Pontuação Fonte
2026-07-16 GFlowRL 2048.0Elo Microsoft lança GFlowRL, um RL estável no estilo GFlowNet para grandes modelos de linguagem
2026-02-12 Gemini 3 Deep Think 3455.0Elo Google lança Gemini 3 Deep Think atualizado com novas pontuações de benchmarks
2025-05-14 Qwen3-235B-A22B 2056.0Elo Qwen3 introduz modo unificado de raciocínio e suporte a 119 idiomas
2025-04-17 o4-mini 2719.0Elo OpenAI lança o4-mini, um modelo de raciocínio multimodal mais rápido e barato
2025-01-22 DeepSeek-R1 2029.0Elo DeepSeek lança modelos de raciocínio R1 por meio de aprendizado por reforço
2025-01-02 QwQ-32B-Preview 1261.0Elo CodeElo apresenta benchmark de geração de código em nível competitivo com classificações Elo comparáveis às humanas
2025-01-02 o1-mini 1578.0Elo CodeElo apresenta benchmark de geração de código em nível competitivo com classificações Elo comparáveis às humanas
2024-12-20 o3 2727.0Elo OpenAI lança modelo o3 com alto desempenho em raciocínio e programação
2024-10-01 OpenAI o1-preview 89.0Elo Comparando o1 da OpenAI com outros principais modelos
2024-09-12 o1 1807.0Elo OpenAI lança o1-preview, um modelo de raciocínio que supera especialistas humanos em benchmarks de matemática e ciências