Benchmark · coding

Codeforces (Elo)

10 resultados 10 modelos

Codeforces (Elo) mide la capacidad de un modelo en programación competitiva haciéndole resolver problemas de concurso con límite de tiempo, y se expresa como una puntuación Elo de Codeforces (aproximadamente 0–4000, donde alrededor de 2000+ ya es un buen nivel).

Leer más
Ejemplo
Un ítem típico es un problema algorítmico con tiempo limitado; por ejemplo, leer la entrada del problema e imprimir la respuesta correcta dentro de estrictos límites de tiempo y memoria, usando técnicas como recorrido de grafos, programación dinámica o algoritmos voraces.
Puntuación
El resultado es un único número Elo calculado a partir de cuántos problemas de concurso resuelve el modelo y de su dificultad, situado en la misma escala de puntuación que Codeforces usa para los competidores humanos.
Verificación
Cada solución enviada se evalúa automáticamente: el código se compila y se ejecuta contra un conjunto oculto de casos de prueba, y solo cuenta como resuelto si produce la salida correcta dentro de los límites de tiempo y memoria.
Por qué importa
Refleja el razonamiento algorítmico de varios pasos y la capacidad de escribir código correcto y eficiente bajo restricciones, y traslada la habilidad de programación de un modelo a una escala de puntuación que la gente ya entiende.
Ejemplo resuelto
Tarea
Watermelon: dado un entero w (1 ≤ w ≤ 100), el peso de una sandía, determina si se puede dividir en dos partes de modo que cada una pese un número par positivo de kilogramos. Imprime «YES» o «NO».
Solución
w = int(input())
print("YES" if w > 2 and w % 2 == 0 else "NO")
Explicación
La suma de dos enteros pares positivos es par y al menos 4, así que existe una división válida exactamente cuando w es par y w > 2 (por ejemplo, w=8 → 2+6). Codeforces califica compilando el envío y ejecutándolo contra casos de prueba ocultos, exigiendo una salida exacta en stdout dentro de los límites de tiempo y memoria.
88 1016 1944 2872 3800 2024-09-12 2025-08-14 2026-07-16 o1 · 1807 · 2024-09-12 OpenAI o1-preview · 89 · 2024-10-01 o3 · 2727 · 2024-12-20 QwQ-32B-Preview · 1261 · 2025-01-02 o1-mini · 1578 · 2025-01-02 DeepSeek-R1 · 2029 · 2025-01-22 o4-mini · 2719 · 2025-04-17 Qwen3-235B-A22B · 2056 · 2025-05-14 Gemini 3 Deep Think · 3455 · 2026-02-12 GFlowRL · 2048 · 2026-07-16
o1 OpenAI o1-preview o3 QwQ-32B-Preview o1-mini DeepSeek-R1 o4-mini Qwen3-235B-A22B Gemini 3 Deep Think GFlowRL
Cronología
Fecha Modelo Puntuación Fuente
2026-07-16 GFlowRL 2048.0Elo Microsoft lanza GFlowRL, un RL estable al estilo GFlowNet para modelos de lenguaje grandes
2026-02-12 Gemini 3 Deep Think 3455.0Elo Google lanza Gemini 3 Deep Think mejorado con nuevas puntuaciones de benchmarks
2025-05-14 Qwen3-235B-A22B 2056.0Elo Qwen3 introduce un modo de pensamiento unificado y soporte para 119 idiomas
2025-04-17 o4-mini 2719.0Elo OpenAI lanza o4-mini, un modelo de razonamiento multimodal más rápido y económico
2025-01-22 DeepSeek-R1 2029.0Elo DeepSeek lanza modelos de razonamiento R1 mediante aprendizaje por refuerzo
2025-01-02 QwQ-32B-Preview 1261.0Elo CodeElo presenta un benchmark de generación de código a nivel competitivo con calificaciones Elo comparables a las humanas
2025-01-02 o1-mini 1578.0Elo CodeElo presenta un benchmark de generación de código a nivel competitivo con calificaciones Elo comparables a las humanas
2024-12-20 o3 2727.0Elo OpenAI lanza el modelo o3 con alto rendimiento en razonamiento y programación
2024-10-01 OpenAI o1-preview 89.0Elo Comparando OpenAI o1 con otros modelos principales
2024-09-12 o1 1807.0Elo OpenAI lanza o1-preview, un modelo de razonamiento que supera a expertos humanos en pruebas de matemáticas y ciencias