Benchmark · coding

LiveCodeBench

20 resultados 18 modelos

LiveCodeBench evalúa qué tan bien los grandes modelos de lenguaje resuelven problemas de competitive programming, usando desafíos de código recopilados de forma continua de concursos recientes para evitar la contaminación de los datos de entrenamiento. La métrica principal es pass@1: la proporción de problemas resueltos correctamente en el primer intento del modelo.

Leer más
Ejemplo
Un elemento típico es un problema de código estilo concurso; por ejemplo, dada una lista de números enteros, escribir una función que devuelva la longitud de la subsecuencia estrictamente creciente más larga, que el modelo debe resolver generando código funcional.
Puntuación
Cada solución generada se ejecuta contra los casos de prueba del problema; pass@1 es la fracción de problemas en los que el primer envío del modelo pasa todas las pruebas.
Verificación
Una solución se acepta automáticamente cuando el código generado pasa todos los casos de prueba ocultos y públicos de ese problema; no hay evaluación humana ni coincidencia exacta de texto.
Por qué importa
Como sus problemas provienen de concursos publicados después de la fecha de corte del entrenamiento de un modelo, LiveCodeBench mide una capacidad real de razonamiento y programación en lugar de respuestas memorizadas, lo que lo convierte en un indicador confiable y resistente a la contaminación de la habilidad para programar.
Ejemplo resuelto
Tarea
Estilo de programación competitiva (stdin/stdout). Dados n enteros, cuenta los pares (i, j) con i < j tales que nums[i] + nums[j] sea par. Entrada: la primera línea es n, la segunda son n enteros separados por espacios; imprime el conteo.
Solución
import sys

def main():
    data = sys.stdin.read().split()
    n = int(data[0])
    nums = list(map(int, data[1:1 + n]))
    odd = sum(x % 2 for x in nums)
    even = n - odd
    print(odd * (odd - 1) // 2 + even * (even - 1) // 2)

main()
Explicación
Una suma es par exactamente cuando ambos sumandos tienen la misma paridad, así que la respuesta es C(evens, 2) + C(odds, 2); contar paridades es O(n). LiveCodeBench ejecuta el programa del modelo contra pruebas unitarias ocultas y lo puntúa con pass@1: correcto solo si pasan todas las pruebas.
0 23 46 69 92 2024-07-15 2025-07-07 2026-06-30 Qwen2-72B-Instruct · 35.7 · 2024-07-15 Qwen2-72B-Instruct · 35.7 · 2024-07-15 QwQ-32B-Preview · 50 · 2024-11-28 DeepSeek-R1-Distill-Qwen-32B · 57.2 · 2025-01-22 Kimi k1.5 (short-CoT) · 47.3 · 2025-01-22 Grok 3 (Think) · 79.4 · 2025-02-19 Grok 3 mini · 80.4 · 2025-02-19 Grok 3 · 79.4 · 2025-03-11 DeepSeek-V3-0324 · 49.2 · 2025-03-24 Gemini 2.5 Pro · 70.4 · 2025-03-26 Gemini 2.0 Flash · 34.5 · 2025-04-15 Qwen3-235B-A22B · 70.7 · 2025-05-14 Deepseek-R1-0528 · 73.3 · 2025-05-30 Kimi K2 · 53.7 · 2025-07-28 Kimi K2 · 53.7 · 2025-07-28 GLM-4.6 · 82.8 · 2025-09-30 Kimi K2 Thinking · 83.1 · 2025-11-07 Step 3.5 Flash · 86.4 · 2026-02-10 Grok 4 · 81.9 · 2026-02-25 Agents-A1 · 44.3 · 2026-06-30
Qwen2-72B-Instruct QwQ-32B-Preview DeepSeek-R1-Distill-Qwen-32B Kimi k1.5 (short-CoT) Grok 3 (Think) Grok 3 mini Grok 3 DeepSeek-V3-0324 Gemini 2.5 Pro Gemini 2.0 Flash Qwen3-235B-A22B Deepseek-R1-0528 Kimi K2 GLM-4.6 Kimi K2 Thinking Step 3.5 Flash Grok 4 Agents-A1
Cronología
Fecha Modelo Puntuación Fuente
2026-06-30 Agents-A1 44.3pts Escalar el horizonte, no los parámetros: alcanzar rendimiento de billones de parámetros con un agente de 35B
2026-02-25 Grok 4 81.9% xAI lanza el modelo de razonamiento Grok 4 con fuertes benchmarks agénticos y de codificación
2026-02-10 Step 3.5 Flash 86.4% Paso 3.5 Flash: modelo MoE abierto con 11B activos alcanza rendimiento de agente de nivel fronterizo
2025-11-07 Kimi K2 Thinking 83.1% Moonshot AI lanza Kimi K2 Thinking, un modelo de razonamiento de código abierto con 1T parámetros
2025-09-30 GLM-4.6 82.8% Zhipu AI lanza GLM-4.6 con capacidades agénticas y ventana de contexto de 128k
2025-07-28 Kimi K2 53.7% Kimi K2: modelo MoE abierto con 1T parámetros y optimizador MuonClip
2025-07-28 Kimi K2 53.7% Moonshot lanza Kimi K2, un modelo MoE agénico abierto con 32B de parámetros activados
2025-05-30 Deepseek-R1-0528 73.3% DeepSeek actualiza el modelo R1 con mejor razonamiento y puntuaciones en benchmarks
2025-05-14 Qwen3-235B-A22B 70.7% Qwen3 introduce un modo de pensamiento unificado y soporte para 119 idiomas
2025-04-15 Gemini 2.0 Flash 34.5% Google lanza Gemini 2.0 Flash con calidad mejorada y el doble de velocidad que Gemini 1.5 Pro
2025-03-26 Gemini 2.5 Pro 70.4% Google lanza el modelo de razonamiento experimental Gemini 2.5 Pro con contexto de 1M tokens
2025-03-24 DeepSeek-V3-0324 49.2% DeepSeek-V3-0324 mejora el razonamiento, la programación y la escritura en chino respecto a DeepSeek-V3
2025-03-11 Grok 3 79.4% xAI lanza Grok 3 con razonamiento profundo y contexto de un millón de tokens
2025-02-19 Grok 3 (Think) 79.4% xAI lanza Grok 3 Beta y el agente DeepSearch
2025-02-19 Grok 3 mini 80.4% xAI lanza Grok 3 Beta y el agente DeepSearch
2025-01-22 DeepSeek-R1-Distill-Qwen-32B 57.2% DeepSeek lanza modelos de razonamiento R1 mediante aprendizaje por refuerzo
2025-01-22 Kimi k1.5 (short-CoT) 47.3% Kimi k1.5 escala el aprendizaje por refuerzo con LLMs para igualar a o1 y superar a los modelos de CoT corto
2024-11-28 QwQ-32B-Preview 50.0% Qwen lanza QwQ-32B-Preview, un modelo de razonamiento experimental
2024-07-15 Qwen2-72B-Instruct 35.7% El equipo de Qwen lanza la serie Qwen2 con modelos densos y MoE de 72B
2024-07-15 Qwen2-72B-Instruct 35.7% El informe técnico de Qwen2 presenta modelos densos y MoE de hasta 72B