Benchmark · coding

LiveCodeBench

20 resultados 18 modelos

O LiveCodeBench avalia o quão bem os grandes modelos de linguagem resolvem problemas de competitive programming, usando desafios de código coletados continuamente de competições recentes para evitar a contaminação dos dados de treino. A métrica principal é o pass@1: a proporção de problemas resolvidos corretamente na primeira tentativa do modelo.

Saiba mais
Exemplo
Um item típico é um problema de código no estilo de competição — por exemplo, dado um vetor de números inteiros, escrever uma função que retorne o comprimento da maior subsequência estritamente crescente — que o modelo precisa resolver gerando código funcional.
Pontuação
Cada solução gerada é executada contra os casos de teste do problema; o pass@1 é a fração de problemas em que a primeira submissão do modelo passa em todos os testes.
Verificação
Uma solução é aceita automaticamente quando o código gerado passa em todos os casos de teste ocultos e públicos daquele problema; não há avaliação humana nem correspondência exata de texto.
Por que importa
Como seus problemas vêm de competições lançadas depois do corte de treino de um modelo, o LiveCodeBench mede uma capacidade real de raciocínio e programação em vez de respostas memorizadas, o que o torna um indicador confiável e resistente à contaminação da habilidade de programar.
Exemplo resolvido
Tarefa
Estilo de programação competitiva (stdin/stdout). Dados n inteiros, conte os pares (i, j) com i < j tais que nums[i] + nums[j] seja par. Entrada: a primeira linha é n, a segunda são n inteiros separados por espaço; imprima a contagem.
Solução
import sys

def main():
    data = sys.stdin.read().split()
    n = int(data[0])
    nums = list(map(int, data[1:1 + n]))
    odd = sum(x % 2 for x in nums)
    even = n - odd
    print(odd * (odd - 1) // 2 + even * (even - 1) // 2)

main()
Explicação
Uma soma é par exatamente quando ambas as parcelas têm a mesma paridade, então a resposta é C(evens, 2) + C(odds, 2); contar paridades é O(n). O LiveCodeBench executa o programa do modelo contra testes unitários ocultos e o pontua em pass@1 — correto apenas se todos os testes passarem.
0 23 46 69 92 2024-07-15 2025-07-10 2026-07-06 Qwen2-72B-Instruct · 35.7 · 2024-07-15 Qwen2-72B-Instruct · 35.7 · 2024-07-15 QwQ-32B-Preview · 50 · 2024-11-28 DeepSeek-R1-Distill-Qwen-32B · 57.2 · 2025-01-22 Kimi k1.5 (short-CoT) · 47.3 · 2025-01-22 Grok 3 (Think) · 79.4 · 2025-02-19 Grok 3 mini · 80.4 · 2025-02-19 Grok 3 · 79.4 · 2025-03-11 DeepSeek-V3-0324 · 49.2 · 2025-03-24 Gemini 2.5 Pro · 70.4 · 2025-03-26 Gemini 2.0 Flash · 34.5 · 2025-04-15 Qwen3-235B-A22B · 70.7 · 2025-05-14 Deepseek-R1-0528 · 73.3 · 2025-05-30 Kimi K2 · 53.7 · 2025-07-28 Kimi K2 · 53.7 · 2025-07-28 GLM-4.6 · 82.8 · 2025-09-30 Kimi K2 Thinking · 83.1 · 2025-11-07 Step 3.5 Flash · 86.4 · 2026-02-10 Grok 4 · 81.9 · 2026-02-25 Agents-A1 · 44.3 · 2026-07-06
Qwen2-72B-Instruct QwQ-32B-Preview DeepSeek-R1-Distill-Qwen-32B Kimi k1.5 (short-CoT) Grok 3 (Think) Grok 3 mini Grok 3 DeepSeek-V3-0324 Gemini 2.5 Pro Gemini 2.0 Flash Qwen3-235B-A22B Deepseek-R1-0528 Kimi K2 GLM-4.6 Kimi K2 Thinking Step 3.5 Flash Grok 4 Agents-A1
Linha do tempo
Data Modelo Pontuação Fonte
2026-07-06 Agents-A1 44.3pts Escalando o Horizonte, Não os Parâmetros: Alcançando Desempenho de Trilhões de Parâmetros com um Agente de 35B
2026-02-25 Grok 4 81.9% xAI lança modelo de raciocínio Grok 4 com fortes benchmarks agênticos e de codificação
2026-02-10 Step 3.5 Flash 86.4% Passo 3.5 Flash: modelo MoE aberto com 11B ativos atinge desempenho de agente de nível fronteira
2025-11-07 Kimi K2 Thinking 83.1% Moonshot AI lança Kimi K2 Thinking, um modelo de raciocínio open-source com 1T parâmetros
2025-09-30 GLM-4.6 82.8% Zhipu AI lança GLM-4.6 com capacidades agênticas e janela de contexto de 128k
2025-07-28 Kimi K2 53.7% Kimi K2: modelo MoE aberto com 1T de parâmetros e otimizador MuonClip
2025-07-28 Kimi K2 53.7% Moonshot lança Kimi K2, um modelo MoE agêntico aberto com 32B de parâmetros ativados
2025-05-30 Deepseek-R1-0528 73.3% DeepSeek atualiza modelo R1 com raciocínio aprimorado e melhores pontuações em benchmarks
2025-05-14 Qwen3-235B-A22B 70.7% Qwen3 introduz modo unificado de raciocínio e suporte a 119 idiomas
2025-04-15 Gemini 2.0 Flash 34.5% Google lança Gemini 2.0 Flash com qualidade aprimorada e o dobro da velocidade do Gemini 1.5 Pro
2025-03-26 Gemini 2.5 Pro 70.4% Google lança modelo de raciocínio experimental Gemini 2.5 Pro com contexto de 1M tokens
2025-03-24 DeepSeek-V3-0324 49.2% DeepSeek-V3-0324 melhora raciocínio, programação e escrita em chinês em relação ao DeepSeek-V3
2025-03-11 Grok 3 79.4% xAI lança Grok 3 com raciocínio profundo e contexto de milhão de tokens
2025-02-19 Grok 3 (Think) 79.4% xAI lança Grok 3 Beta e agente DeepSearch
2025-02-19 Grok 3 mini 80.4% xAI lança Grok 3 Beta e agente DeepSearch
2025-01-22 DeepSeek-R1-Distill-Qwen-32B 57.2% DeepSeek lança modelos de raciocínio R1 por meio de aprendizado por reforço
2025-01-22 Kimi k1.5 (short-CoT) 47.3% Kimi k1.5 escala aprendizado por reforço com LLMs para igualar o1 e superar modelos de CoT curto
2024-11-28 QwQ-32B-Preview 50.0% Qwen lança QwQ-32B-Preview, um modelo de raciocínio experimental
2024-07-15 Qwen2-72B-Instruct 35.7% Equipe Qwen lança série Qwen2 com modelos densos e MoE de 72B
2024-07-15 Qwen2-72B-Instruct 35.7% Relatório Técnico do Qwen2 apresenta modelos densos e MoE até 72B