Benchmark · coding

Aider Polyglot

27 resultados 25 modelos

Aider Polyglot é um benchmark de edição de código da ferramenta Aider que avalia o quão bem um LLM edita código existente em muitas linguagens de programação. A pontuação é a porcentagem de tarefas cujas edições produzem código correto que passa nos testes da tarefa.

Saiba mais
Exemplo
Um item típico é um exercício de programação no estilo Exercism em uma de várias linguagens (Python, Rust, Go, Java, JavaScript ou C++), no qual o modelo precisa editar os arquivos-fonte fornecidos para implementar a função exigida e passar nos testes.
Pontuação
A métrica é a porcentagem de tarefas resolvidas: uma tarefa só conta quando o código editado passa em todos os seus testes automáticos. O Aider também acompanha com que frequência as edições voltam no formato correto e aplicável.
Verificação
Os resultados são verificados automaticamente: os arquivos editados são executados contra o conjunto de testes unitários do exercício, e uma tarefa passa apenas se todos os testes passarem — sem votos humanos nem comparação por correspondência exata.
Por que importa
Ele espelha o fluxo de trabalho real de um desenvolvedor — editar arquivos existentes em muitas linguagens em vez de escrever trechos do zero —, sendo um sinal prático de quão útil um modelo é como assistente de programação.
Exemplo resolvido
Tarefa
Aider Polyglot tira exercícios do Exercism em 6 linguagens: o modelo recebe a especificação de um problema mais um arquivo de esqueleto (por ex. acronym.py com def abbreviate(words): ...) e deve editá-lo para que a suíte oculta de pytest passe. Exemplo de especificação: converter uma frase em sua sigla — 'Portable Network Graphics' → 'PNG', tratando espaços, hifens e sublinhados como separadores e ignorando a demais pontuação.
Solução
import re

def abbreviate(words):
    return "".join(w[0].upper() for w in re.findall(r"[A-Za-z']+", words))
Explicação
A expressão regular extrai os tokens de palavra (letras mais apóstrofos internos), pega a primeira letra de cada token, coloca em maiúscula e as junta, de modo que 'Portable Network Graphics' → 'PNG'. A avaliação roda os testes unitários ocultos do exercício; o item pontua só se todos passarem (o aider reporta pass@2 na suíte).
0 23.5 47 70.5 94 2024-12-21 2025-10-13 2026-08-06 o1 · 62 · 2024-12-21 R1+Sonnet · 64 · 2025-01-24 GPT-4.5 · 45 · 2025-03-05 Gemini 2.5 Pro · 74 · 2025-03-26 Gemini 2.5 Pro · 83.1 · 2026-03-10 GPT-4.1 · 52.9 · 2025-04-14 GPT‑4.1 nano · 9.8 · 2025-04-14 o4-mini-high · 68.9 · 2025-04-17 Qwen3 235B A22B whole, no think, via official Alibaba API · 61.8 · 2025-05-08 Qwen3-235B-A22B whole with VLLM, bfloat16, recommended /no_think settings · 65.3 · 2025-05-08 Claude Opus 4 · 72 · 2025-05-23 Deepseek-R1-0528 · 71.6 · 2025-05-30 Gemini 2.5 06-05 · 82.2 · 2025-06-05 Grok 4 Heavy · 79.6 · 2025-07-10 GPT-5 · 88 · 2025-08-07 GPT-5 · 88 · 2025-08-07 GPT‑5 · 88 · 2025-08-07 DeepSeek V3.1 · 71.6 · 2025-08-20 Qwen3-Coder-480B-A35B-Instruct · 61.8 · 2025-10-17 GPT-5 with high reasoning effort · 88 · 2026-03-10 o3-pro · 84.9 · 2026-03-10 Claude Sonnet 4 · 61 · 2026-03-10 GPT-5 with medium reasoning · 81.3 · 2026-03-10 o4-mini · 80.8 · 2026-03-10 Argus · 76.8 · 2026-08-06 DeepSeek R1 · 56.9 · 2025-01-20 Claude 3.7 Sonnet · 64.9 · 2025-02-24
o1 R1+Sonnet GPT-4.5 Gemini 2.5 Pro GPT-4.1 GPT‑4.1 nano o4-mini-high Qwen3 235B A22B whole, no think, via official Alibaba API Qwen3-235B-A22B whole with VLLM, bfloat16, recommended /no_think settings Claude Opus 4 Deepseek-R1-0528 Gemini 2.5 06-05 Grok 4 Heavy GPT-5 GPT‑5 DeepSeek V3.1 Qwen3-Coder-480B-A35B-Instruct GPT-5 with high reasoning effort o3-pro Claude Sonnet 4 GPT-5 with medium reasoning o4-mini Argus DeepSeek R1 Claude 3.7 Sonnet
Linha do tempo
Data Modelo Pontuação Fonte
2026-08-06 Argus 76.8% Argus: Um Runtime Agêntico de Propósito Geral para Raciocínio de Longo Prazo
2026-03-10 GPT-5 with high reasoning effort 88.0% GPT-5 lidera o benchmark Aider Polyglot com 88% e alto esforço de raciocínio
2026-03-10 o3-pro 84.9% GPT-5 lidera o benchmark Aider Polyglot com 88% e alto esforço de raciocínio
2026-03-10 Gemini 2.5 Pro 83.1% GPT-5 lidera o benchmark Aider Polyglot com 88% e alto esforço de raciocínio
2026-03-10 Claude Sonnet 4 61.0% GPT-5 lidera o benchmark Aider Polyglot com 88% e alto esforço de raciocínio
2026-03-10 GPT-5 with medium reasoning 81.3% GPT-5 lidera o benchmark Aider Polyglot com 88% e alto esforço de raciocínio
2026-03-10 o4-mini 80.8% GPT-5 lidera o benchmark Aider Polyglot com 88% e alto esforço de raciocínio
2025-10-17 Qwen3-Coder-480B-A35B-Instruct 61.8% Alibaba lança Qwen3-Coder-480B-A35B-Instruct, modelo de código aberto para programação com desempenho equivalente ao proprietário
2025-08-20 DeepSeek V3.1 71.6% DeepSeek lança modelo de raciocínio híbrido V3.1 com taxa de aprovação de 71,6% no Aider
2025-08-07 GPT-5 88.0% OpenAI apresenta GPT-5 com roteamento unificado e raciocínio de nível especialista
2025-08-07 GPT-5 88.0% OpenAI lança GPT-5 com raciocínio adaptativo e arquitetura unificada
2025-08-07 GPT‑5 88.0% OpenAI lança API do GPT-5 com melhorias em codificação e agentes
2025-07-10 Grok 4 Heavy 79.6% xAI lança Grok 4 com camada Heavy multi-agente e dados da web em tempo real
2025-06-05 Gemini 2.5 06-05 82.2% Google lança pré-visualização do Gemini 2.5 06-05 com melhorias em codificação e raciocínio
2025-05-30 Deepseek-R1-0528 71.6% DeepSeek atualiza modelo R1 com raciocínio aprimorado e melhores pontuações em benchmarks
2025-05-23 Claude Opus 4 72.0% Anthropic lança Claude Opus 4 e Sonnet 4 com raciocínio híbrido
2025-05-08 Qwen3 235B A22B whole, no think, via official Alibaba API 61.8% Resultados do benchmark Qwen3 mostram desempenho de codificação entre provedores
2025-05-08 Qwen3-235B-A22B whole with VLLM, bfloat16, recommended /no_think settings 65.3% Resultados do benchmark Qwen3 mostram desempenho de codificação entre provedores
2025-04-17 o4-mini-high 68.9% OpenAI lança o4-mini, um modelo de raciocínio multimodal mais rápido e barato
2025-04-14 GPT-4.1 52.9% OpenAI lança família GPT-4.1 com contexto de 1M de tokens e melhorias em codificação
2025-04-14 GPT‑4.1 nano 9.8% OpenAI lança GPT-4.1, GPT-4.1 mini e GPT-4.1 nano na API
2025-03-26 Gemini 2.5 Pro 74.0% Google lança modelo de raciocínio experimental Gemini 2.5 Pro com contexto de 1M tokens
2025-03-05 GPT-4.5 45.0% OpenAI lança GPT-4.5, seu maior modelo, para o ChatGPT Plus
2025-02-24 Claude 3.7 Sonnet 64.9% Aider leaderboard
2025-01-24 R1+Sonnet 64.0% R1+Sonnet define novo SOTA no benchmark poliglota do aider
2025-01-20 DeepSeek R1 56.9% Aider leaderboard
2024-12-21 o1 62.0% OpenAI o1 lidera novo e desafiador ranking de codificação poliglota do Aider