Benchmark · agentic

SWE-bench Verified

64 resultados 43 modelos

Evalúa si un agente de IA puede resolver issues reales de GitHub de principio a fin. El conjunto «Verified» son 500 tareas validadas por humanos, tomadas de repositorios Python de código abierto populares.

Leer más
Ejemplo
Dado un informe de error y el repositorio, el modelo debe producir un patch de código — por ejemplo, arreglar una función de parseo de fechas que falla para que la suite de pruebas del proyecto pase.
Puntuación
% de issues resueltos — normalmente se reporta como pass@1 (un solo intento). Cuanto más alto, mejor.
Verificación
Totalmente automático: el patch generado se aplica y las pruebas unitarias ocultas reales del proyecto se ejecutan en un sandbox. Una tarea cuenta solo si todas las pruebas objetivo pasan y no se produce ninguna regresión.
Por qué importa
El principal benchmark de agentes de programación en escenarios reales y una cifra destacada en cada lanzamiento frontier; el progreso aquí refleja cuán cerca están los agentes de la ingeniería de software autónoma.
Ejemplo resuelto
Tarea
Repositorio django/django en un commit base fijo. Informe de error: django.utils.text.slugify("___This-is-a-Test___", allow_unicode=True) devuelve '___this-is-a-test___', pero los guiones bajos y guiones iniciales y finales deberían eliminarse para que el resultado sea 'this-is-a-test'. El modelo recibe únicamente el texto del issue junto con el repositorio y debe producir un patch en formato unified diff.
Solución
--- a/django/utils/text.py
+++ b/django/utils/text.py
@@ def slugify(value, allow_unicode=False):
     value = re.sub(r"[^\w\s-]", "", value.lower())
-    return re.sub(r"[-\s]+", "-", value)
+    return re.sub(r"[-\s]+", "-", value).strip("-_")
Explicación
slugify colapsa los separadores internos pero nunca recorta los -/_ circundantes, así que añadir .strip("-_") al re.sub final los elimina; el patch es mínimo y preserva todo el demás comportamiento. SWE-bench Verified aplica el patch al repositorio en el commit base y califica ejecutando la suite oculta — pasa solo si cada prueba FAIL_TO_PASS pasa a estar en verde mientras todas las pruebas PASS_TO_PASS siguen en verde.
0 25 50 75 100 2024-08-13 2025-08-08 2026-08-03 GPT‑4o · 33.2 · 2024-08-13 Agentless · 32 · 2024-08-13 Claude 3.5 Haiku · 40.6 · 2024-10-22 Claude 3.5 Sonnet · 49 · 2024-10-22 Claude 3.5 Sonnet · 49 · 2024-10-22 Claude 3.5 Sonnet · 49 · 2024-10-30 Claude 3.5 Sonnet · 49 · 2025-01-06 o3 · 71.7 · 2024-12-20 o3 · 71.7 · 2024-12-20 o3 · 71.7 · 2026-03-25 GPT-4.5 · 38 · 2025-03-05 Gemini 2.5 Pro · 63.8 · 2025-03-25 Gemini 2.5 Pro · 63.8 · 2025-03-25 Gemini 2.5 Pro · 63.8 · 2025-03-25 Gemini 2.5 Pro · 63.8 · 2025-03-26 GPT‑4.1 · 54.6 · 2025-04-14 GPT-4.1 · 54.6 · 2025-04-14 o4-mini · 68.1 · 2025-04-17 Devstral · 46.8 · 2025-05-21 Claude Opus 4 · 72.5 · 2025-05-22 Claude Opus 4 · 72.5 · 2025-05-23 Claude Sonnet 4 · 72.7 · 2025-05-23 Deepseek-R1-0528 · 57.6 · 2025-05-30 Devstral Medium · 61.6 · 2025-07-10 Devstral Small 1.1 · 53.6 · 2025-07-10 Kimi K2 · 65.8 · 2025-07-11 Kimi K2 · 65.8 · 2025-07-28 Kimi K2 · 65.8 · 2025-07-28 Kimi K2-Instruct · 65.8 · 2025-07-11 GLM-4.5 · 64.2 · 2025-08-06 GPT‑5 · 74.9 · 2025-08-07 GPT-5 · 74.9 · 2025-08-07 GPT-5 · 74.9 · 2025-08-07 GPT-5 · 74.9 · 2025-08-07 GPT-5 · 74.9 · 2025-08-07 Claude Sonnet 4.5 · 77.2 · 2025-09-29 Claude Sonnet 4.5 · 77.2 · 2025-09-30 Kimi K2 Thinking · 71.3 · 2025-11-07 Kimi K2 Thinking · 71.3 · 2025-11-19 GPT-5.1-Codex-Max · 77.9 · 2025-11-19 Devstral Small 2 · 68 · 2025-12-09 Devstral Small 2 · 68 · 2026-07-17 Devstral 2 · 72.2 · 2025-12-09 Devstral 2 · 72.2 · 2026-07-17 GPT-5.2 Thinking · 80 · 2025-12-11 GPT-5.2 Thinking · 80 · 2025-12-11 Qwen3.6-27B · 77.2 · 2026-01-28 Qwen3.6-27B · 77.2 · 2026-04-25 Claude Opus 4.6 · 80.8 · 2026-02-01 Claude Opus 4.6 · 80.8 · 2026-02-05 MiniMax M2.5 · 80.2 · 2026-02-01 Claude Sonnet 4.6 · 79.6 · 2026-02-17 V4-Pro-Max · 80.6 · 2026-04-24 LoopCoder-V2 · 64.4 · 2026-06-27 LoopCoder-v2 · 64.4 · 2026-06-28 LLM-as-a-Verifier · 78.2 · 2026-07-07 Qwen3-30B-A3B · 6 · 2026-07-14 Qwen3.5-35B-A3B · 6 · 2026-07-14 DeepSeek V4 Pro · 80.6 · 2026-07-19 Claude Opus 5 · 96 · 2026-07-24 Inkling-Small · 80.2 · 2026-08-03 Orchard-SWE · 69.7 · 2026-08-03 Claude 3.7 Sonnet · 62.3 · 2025-02-24 OpenAI o3 · 71.7 · 2025-04-16
GPT‑4o Agentless Claude 3.5 Haiku Claude 3.5 Sonnet o3 GPT-4.5 Gemini 2.5 Pro GPT‑4.1 GPT-4.1 o4-mini Devstral Claude Opus 4 Claude Sonnet 4 Deepseek-R1-0528 Devstral Medium Devstral Small 1.1 Kimi K2 Kimi K2-Instruct GLM-4.5 GPT‑5 GPT-5 Claude Sonnet 4.5 Kimi K2 Thinking GPT-5.1-Codex-Max Devstral Small 2 Devstral 2 GPT-5.2 Thinking Qwen3.6-27B Claude Opus 4.6 MiniMax M2.5 Claude Sonnet 4.6 V4-Pro-Max LoopCoder-V2 LoopCoder-v2 LLM-as-a-Verifier Qwen3-30B-A3B Qwen3.5-35B-A3B DeepSeek V4 Pro Claude Opus 5 Inkling-Small Orchard-SWE Claude 3.7 Sonnet OpenAI o3
Cronología
Fecha Modelo Puntuación Fuente
2026-08-03 Orchard-SWE 69.7% Microsoft Research lanza el framework Orchard para IA agente escalable
2026-08-03 Inkling-Small 80.2% Thinking Machines Lab lanza Inkling-Small, un modelo MoE multimodal de pesos abiertos con 276B
2026-07-24 Claude Opus 5 96.0% Anthropic lanza Claude Opus 5 con pensamiento por defecto y mejoras en codificación agéntica
2026-07-19 DeepSeek V4 Pro 80.6% Kimi K3, DeepSeek V4 Pro y GLM-5.2 comparados en benchmarks, licencia y costo de servicio
2026-07-17 Devstral 2 72.2% Mistral Vibe for Code lidera a cuatro agentes de codificación en la tarea de scaffold-a-PR
2026-07-17 Devstral Small 2 68.0% Mistral Vibe for Code lidera a cuatro agentes de codificación en la tarea de scaffold-a-PR
2026-07-14 Qwen3-30B-A3B 6.0% UMoE reorganiza los conjuntos de expertos de MoE para un ajuste fino específico del dominio mejorado
2026-07-14 Qwen3.5-35B-A3B 6.0% UMoE reorganiza los conjuntos de expertos de MoE para un ajuste fino específico del dominio mejorado
2026-07-07 LLM-as-a-Verifier 78.2% LLM-as-a-Verifier presenta un marco de verificación de propósito general con puntuación continua
2026-06-28 LoopCoder-v2 64.4% LoopCoder-v2 logra el rendimiento óptimo en bucles anidados
2026-06-27 LoopCoder-V2 64.4% LoopCoder-V2: Modelo PLT de dos bucles logra la mejor relación ganancia-coste
2026-04-25 Qwen3.6-27B 77.2% Alibaba lanza Qwen3.6-27B, superando al predecesor más grande en benchmarks de programación
2026-04-24 V4-Pro-Max 80.6% DeepSeek lanza V4 con una arquitectura eficiente de contexto largo para agentes
2026-03-25 o3 71.7% OpenAI anuncia la retirada de o3 de ChatGPT y comparte puntuaciones de benchmarks
2026-02-17 Claude Sonnet 4.6 79.6% Anthropic lanza Claude Sonnet 4.6 con mejor codificación, uso de computadora y contexto de 1M de tokens
2026-02-05 Claude Opus 4.6 80.8% Anthropic lanza Claude Opus 4.6 con ventana de contexto de 1M y mejoras agénticas
2026-02-01 Claude Opus 4.6 80.8% Los benchmarks descontaminados revelan una brecha de 12 puntos entre los principales modelos de codificación con IA
2026-02-01 MiniMax M2.5 80.2% Los benchmarks descontaminados revelan una brecha de 12 puntos entre los principales modelos de codificación con IA
2026-01-28 Qwen3.6-27B 77.2% Qwen 3.6-27B y DeepSeek V4 Flash lideran benchmarks de codificación local
2025-12-11 GPT-5.2 Thinking 80.0% OpenAI presenta GPT-5.2 con capacidades de vanguardia para el trabajo profesional del conocimiento
2025-12-11 GPT-5.2 Thinking 80.0% OpenAI lanza GPT-5.2, superando a Gemini 3 en benchmarks de codificación y razonamiento
2025-12-09 Devstral Small 2 68.0% Mistral lanza los modelos de codificación Devstral 2 y Mistral Vibe CLI
2025-12-09 Devstral 2 72.2% Mistral lanza los modelos de codificación Devstral 2 y Mistral Vibe CLI
2025-11-19 Kimi K2 Thinking 71.3% Moonshot AI lanza Kimi K2 Thinking con uso de herramientas agénticas
2025-11-19 GPT-5.1-Codex-Max 77.9% OpenAI establece GPT-5.1-Codex-Max como predeterminado en Codex CLI
2025-11-07 Kimi K2 Thinking 71.3% Moonshot AI lanza Kimi K2 Thinking, un modelo de razonamiento de código abierto con 1T parámetros
2025-09-30 Claude Sonnet 4.5 77.2% Anthropic lanza Claude Sonnet 4.5 con capacidades mejoradas de codificación y agentes
2025-09-29 Claude Sonnet 4.5 77.2% Anthropic
2025-08-07 GPT‑5 74.9% OpenAI lanza la API de GPT-5 con mejoras en codificación y agentes
2025-08-07 GPT-5 74.9% OpenAI presenta GPT-5 con enrutamiento unificado y razonamiento de nivel experto
2025-08-07 GPT-5 74.9% OpenAI lanza GPT-5 con razonamiento adaptativo y arquitectura unificada
2025-08-07 GPT-5 74.9% OpenAI lanza GPT-5 unificado con enrutamiento en tiempo real y acceso gratuito
2025-08-07 GPT-5 74.9% OpenAI
2025-08-06 GLM-4.5 64.2% Zhipu AI lanza los modelos GLM-4.5 que igualan a Claude y DeepSeek
2025-07-28 Kimi K2 65.8% Moonshot lanza Kimi K2, un modelo MoE agénico abierto con 32B de parámetros activados
2025-07-28 Kimi K2 65.8% Kimi K2: modelo MoE abierto con 1T parámetros y optimizador MuonClip
2025-07-11 Kimi K2 65.8% Moonshot AI lanza Kimi K2, un modelo MoE de 1T parámetros con capacidades agénticas
2025-07-11 Kimi K2-Instruct 65.8% Moonshot AI lanza Kimi-K2-Instruct, un modelo MoE de 1T parámetros con capacidades agénticas
2025-07-10 Devstral Medium 61.6% Mistral AI lanza Devstral Small 1.1 y Devstral Medium con All Hands AI
2025-07-10 Devstral Small 1.1 53.6% Mistral AI lanza Devstral Small 1.1 y Devstral Medium con All Hands AI
2025-05-30 Deepseek-R1-0528 57.6% DeepSeek actualiza el modelo R1 con mejor razonamiento y puntuaciones en benchmarks
2025-05-23 Claude Opus 4 72.5% Anthropic lanza Claude Opus 4 y Sonnet 4 con razonamiento híbrido
2025-05-23 Claude Sonnet 4 72.7% Anthropic lanza Claude Opus 4 y Sonnet 4 con razonamiento híbrido
2025-05-22 Claude Opus 4 72.5% Anthropic
2025-05-21 Devstral 46.8% Mistral AI lanza Devstral, un LLM agente para ingeniería de software
2025-04-17 o4-mini 68.1% OpenAI lanza o4-mini, un modelo de razonamiento multimodal más rápido y económico
2025-04-16 OpenAI o3 71.7% OpenAI
2025-04-14 GPT‑4.1 54.6% OpenAI lanza GPT-4.1, GPT-4.1 mini y GPT-4.1 nano en la API
2025-04-14 GPT-4.1 54.6% OpenAI lanza la familia GPT-4.1 con contexto de 1M de tokens y mejoras en programación
2025-03-26 Gemini 2.5 Pro 63.8% Google lanza el modelo de razonamiento experimental Gemini 2.5 Pro con contexto de 1M tokens
2025-03-25 Gemini 2.5 Pro 63.8% Google presenta el modelo de pensamiento Gemini 2.5 Pro
2025-03-25 Gemini 2.5 Pro 63.8% Google presenta el modelo experimental Gemini 2.5 Pro
2025-03-25 Gemini 2.5 Pro 63.8% Google DeepMind
2025-03-05 GPT-4.5 38.0% OpenAI lanza GPT-4.5, su modelo más grande, para ChatGPT Plus
2025-02-24 Claude 3.7 Sonnet 62.3% Anthropic
2025-01-06 Claude 3.5 Sonnet 49.0% Claude 3.5 Sonnet alcanza el 49% en SWE-bench Verified
2024-12-20 o3 71.7% OpenAI lanza el modelo o3 con alto rendimiento en razonamiento y programación
2024-12-20 o3 71.7% OpenAI presenta el modelo de razonamiento o3 con avances en ARC AGI y Frontier Math
2024-10-30 Claude 3.5 Sonnet 49.0% Claude 3.5 Sonnet alcanza el 49% en SWE-bench Verified con andamiaje mínimo de agente
2024-10-22 Claude 3.5 Haiku 40.6% Anthropic actualiza Claude 3.5 Sonnet, lanza Claude 3.5 Haiku y la versión beta de uso del ordenador
2024-10-22 Claude 3.5 Sonnet 49.0% Anthropic actualiza Claude 3.5 Sonnet, lanza Claude 3.5 Haiku y la versión beta de uso del ordenador
2024-10-22 Claude 3.5 Sonnet 49.0% Anthropic
2024-08-13 GPT‑4o 33.2% OpenAI lanza SWE-bench Verified con un subconjunto validado por humanos
2024-08-13 Agentless 32.0% OpenAI lanza SWE-bench Verified con un subconjunto validado por humanos