Benchmark · coding

Aider Polyglot

27 resultados 25 modelos

Aider Polyglot es un benchmark de edición de código de la herramienta Aider que evalúa qué tan bien un LLM edita código existente en muchos lenguajes de programación. La puntuación es el porcentaje de tareas cuyas ediciones producen código correcto que pasa las pruebas de la tarea.

Leer más
Ejemplo
Un ítem típico es un ejercicio de programación al estilo de Exercism en uno de varios lenguajes (Python, Rust, Go, Java, JavaScript o C++), donde el modelo debe editar los archivos fuente proporcionados para implementar la función requerida y pasar las pruebas.
Puntuación
La métrica es el porcentaje de tareas resueltas: una tarea cuenta solo cuando el código editado pasa todas sus pruebas automáticas. Aider también mide con qué frecuencia las ediciones llegan en el formato correcto y aplicable.
Verificación
Los resultados se verifican de forma automática: los archivos editados se ejecutan contra el conjunto de pruebas unitarias del ejercicio, y una tarea se aprueba solo si pasan todas las pruebas, sin votos humanos ni comparación por coincidencia exacta.
Por qué importa
Refleja el flujo de trabajo real de un desarrollador —editar archivos existentes en muchos lenguajes en vez de escribir fragmentos desde cero—, por lo que es una señal práctica de cuán útil es un modelo como asistente de programación.
Ejemplo resuelto
Tarea
Aider Polyglot toma ejercicios de Exercism en 6 lenguajes: el modelo recibe la especificación de un problema más un archivo de esqueleto (p. ej. acronym.py con def abbreviate(words): ...) y debe editarlo para que pase la suite oculta de pytest. Ejemplo de especificación: convertir una frase en su acrónimo — 'Portable Network Graphics' → 'PNG', tratando espacios, guiones y guiones bajos como separadores e ignorando el resto de la puntuación.
Solución
import re

def abbreviate(words):
    return "".join(w[0].upper() for w in re.findall(r"[A-Za-z']+", words))
Explicación
La expresión regular extrae los tokens de palabra (letras más apóstrofos internos), toma la primera letra de cada token, la pone en mayúscula y las une, de modo que 'Portable Network Graphics' → 'PNG'. La calificación ejecuta las pruebas unitarias ocultas del ejercicio; el ítem puntúa solo si pasan todas (aider reporta pass@2 sobre la suite).
0 23.5 47 70.5 94 2024-12-21 2025-10-13 2026-08-06 o1 · 62 · 2024-12-21 R1+Sonnet · 64 · 2025-01-24 GPT-4.5 · 45 · 2025-03-05 Gemini 2.5 Pro · 74 · 2025-03-26 Gemini 2.5 Pro · 83.1 · 2026-03-10 GPT-4.1 · 52.9 · 2025-04-14 GPT‑4.1 nano · 9.8 · 2025-04-14 o4-mini-high · 68.9 · 2025-04-17 Qwen3 235B A22B whole, no think, via official Alibaba API · 61.8 · 2025-05-08 Qwen3-235B-A22B whole with VLLM, bfloat16, recommended /no_think settings · 65.3 · 2025-05-08 Claude Opus 4 · 72 · 2025-05-23 Deepseek-R1-0528 · 71.6 · 2025-05-30 Gemini 2.5 06-05 · 82.2 · 2025-06-05 Grok 4 Heavy · 79.6 · 2025-07-10 GPT-5 · 88 · 2025-08-07 GPT-5 · 88 · 2025-08-07 GPT‑5 · 88 · 2025-08-07 DeepSeek V3.1 · 71.6 · 2025-08-20 Qwen3-Coder-480B-A35B-Instruct · 61.8 · 2025-10-17 GPT-5 with high reasoning effort · 88 · 2026-03-10 o3-pro · 84.9 · 2026-03-10 Claude Sonnet 4 · 61 · 2026-03-10 GPT-5 with medium reasoning · 81.3 · 2026-03-10 o4-mini · 80.8 · 2026-03-10 Argus · 76.8 · 2026-08-06 DeepSeek R1 · 56.9 · 2025-01-20 Claude 3.7 Sonnet · 64.9 · 2025-02-24
o1 R1+Sonnet GPT-4.5 Gemini 2.5 Pro GPT-4.1 GPT‑4.1 nano o4-mini-high Qwen3 235B A22B whole, no think, via official Alibaba API Qwen3-235B-A22B whole with VLLM, bfloat16, recommended /no_think settings Claude Opus 4 Deepseek-R1-0528 Gemini 2.5 06-05 Grok 4 Heavy GPT-5 GPT‑5 DeepSeek V3.1 Qwen3-Coder-480B-A35B-Instruct GPT-5 with high reasoning effort o3-pro Claude Sonnet 4 GPT-5 with medium reasoning o4-mini Argus DeepSeek R1 Claude 3.7 Sonnet
Cronología
Fecha Modelo Puntuación Fuente
2026-08-06 Argus 76.8% Argus: Un entorno de ejecución agénico de propósito general para razonamiento a largo plazo
2026-03-10 GPT-5 with high reasoning effort 88.0% GPT-5 encabeza el benchmark Aider Polyglot con un 88% y alto esfuerzo de razonamiento
2026-03-10 o3-pro 84.9% GPT-5 encabeza el benchmark Aider Polyglot con un 88% y alto esfuerzo de razonamiento
2026-03-10 Gemini 2.5 Pro 83.1% GPT-5 encabeza el benchmark Aider Polyglot con un 88% y alto esfuerzo de razonamiento
2026-03-10 Claude Sonnet 4 61.0% GPT-5 encabeza el benchmark Aider Polyglot con un 88% y alto esfuerzo de razonamiento
2026-03-10 GPT-5 with medium reasoning 81.3% GPT-5 encabeza el benchmark Aider Polyglot con un 88% y alto esfuerzo de razonamiento
2026-03-10 o4-mini 80.8% GPT-5 encabeza el benchmark Aider Polyglot con un 88% y alto esfuerzo de razonamiento
2025-10-17 Qwen3-Coder-480B-A35B-Instruct 61.8% Alibaba lanza Qwen3-Coder-480B-A35B-Instruct, un modelo de código abierto para programación que iguala el rendimiento propietario
2025-08-20 DeepSeek V3.1 71.6% DeepSeek lanza el modelo de razonamiento híbrido V3.1 con una tasa de aprobación del 71,6% en Aider
2025-08-07 GPT-5 88.0% OpenAI presenta GPT-5 con enrutamiento unificado y razonamiento de nivel experto
2025-08-07 GPT-5 88.0% OpenAI lanza GPT-5 con razonamiento adaptativo y arquitectura unificada
2025-08-07 GPT‑5 88.0% OpenAI lanza la API de GPT-5 con mejoras en codificación y agentes
2025-07-10 Grok 4 Heavy 79.6% xAI lanza Grok 4 con capa Heavy multi-agente y datos web en vivo
2025-06-05 Gemini 2.5 06-05 82.2% Google lanza la vista previa de Gemini 2.5 06-05 con mejoras en codificación y razonamiento
2025-05-30 Deepseek-R1-0528 71.6% DeepSeek actualiza el modelo R1 con mejor razonamiento y puntuaciones en benchmarks
2025-05-23 Claude Opus 4 72.0% Anthropic lanza Claude Opus 4 y Sonnet 4 con razonamiento híbrido
2025-05-08 Qwen3 235B A22B whole, no think, via official Alibaba API 61.8% Los resultados de los benchmarks de Qwen3 muestran el rendimiento en programación entre proveedores
2025-05-08 Qwen3-235B-A22B whole with VLLM, bfloat16, recommended /no_think settings 65.3% Los resultados de los benchmarks de Qwen3 muestran el rendimiento en programación entre proveedores
2025-04-17 o4-mini-high 68.9% OpenAI lanza o4-mini, un modelo de razonamiento multimodal más rápido y económico
2025-04-14 GPT-4.1 52.9% OpenAI lanza la familia GPT-4.1 con contexto de 1M de tokens y mejoras en programación
2025-04-14 GPT‑4.1 nano 9.8% OpenAI lanza GPT-4.1, GPT-4.1 mini y GPT-4.1 nano en la API
2025-03-26 Gemini 2.5 Pro 74.0% Google lanza el modelo de razonamiento experimental Gemini 2.5 Pro con contexto de 1M tokens
2025-03-05 GPT-4.5 45.0% OpenAI lanza GPT-4.5, su modelo más grande, para ChatGPT Plus
2025-02-24 Claude 3.7 Sonnet 64.9% Aider leaderboard
2025-01-24 R1+Sonnet 64.0% R1+Sonnet establece un nuevo récord en la prueba políglota de aider
2025-01-20 DeepSeek R1 56.9% Aider leaderboard
2024-12-21 o1 62.0% OpenAI o1 encabeza el nuevo y desafiante ranking de codificación políglota de Aider