Benchmark · agentic

SWE-bench Pro

19 resultados 13 modelos

Una versión de SWE-bench más difícil y resistente a la contaminación, creada por Scale AI. Extrae ~1,865 issues reales de GitHub de repositorios empresariales, de startups y de código abierto reservados en los que los modelos no fueron entrenados, y las correcciones suelen abarcar varios archivos.

Leer más
Ejemplo
Dado un issue real y el repositorio completo, el agente debe producir un parche —que a menudo modifica varios archivos— para que la suite de pruebas oculta del proyecto pase. Los problemas provienen de repositorios privados y comerciales precisamente para evitar la filtración de datos de entrenamiento.
Puntuación
% de issues resueltos, reportado como pass@1 (un intento). Cuanto más alto, mejor. Las puntuaciones son más bajas que en SWE-bench Verified porque las tareas son más difíciles y no se habían visto antes.
Verificación
Totalmente automático y con datos reservados: el parche generado se aplica y las pruebas unitarias ocultas reales del repositorio se ejecutan en un sandbox. Una tarea solo cuenta si todas las pruebas objetivo pasan y no se produce ninguna otra regresión.
Por qué importa
Diseñado para resistir la contaminación y la saturación que inflan las puntuaciones en SWE-bench Verified, de modo que es una señal más limpia de la habilidad real y generalizable de un agente de programación sobre código que el modelo nunca ha visto.
Ejemplo resuelto
Tarea
Repositorio acme/payments en un commit base fijo. Issue: Money('0.05').allocate([1, 1, 1]) pierde un centavo — las tres partes suman $0.04, no $0.05. Produce un parche para que un reparto siempre vuelva a sumar el importe original.
Solución
--- a/payments/money.py
+++ b/payments/money.py
@@ def allocate(self, ratios):
-        total = sum(ratios)
-        return [self._from_minor(self.minor * r // total) for r in ratios]
+        total = sum(ratios)
+        shares = [self.minor * r // total for r in ratios]
+        remainder = self.minor - sum(shares)
+        for i in range(remainder):
+            shares[i] += 1
+        return [self._from_minor(s) for s in shares]
Explicación
La división entera trunca, por lo que las unidades menores restantes (centavos) se perdían silenciosamente. La corrección calcula cada parte y luego distribuye el resto de una unidad a la vez entre las primeras partes, garantizando que las partes asignadas siempre sumen el total. Las pruebas ocultas verifican sum(m.allocate(ratios)) == m en varios importes y proporciones.
0 21.5 43 64.5 86 2025-12-11 2026-04-15 2026-08-19 GPT-5.2 Thinking · 55.6 · 2025-12-11 GPT-5.2 Thinking · 55.6 · 2025-12-11 GPT-5.2 Thinking · 55.6 · 2025-12-11 GPT-5.5 · 58.6 · 2026-04-23 GPT-5.5 · 58.6 · 2026-04-23 Claude Opus 4.7 · 64.3 · 2026-04-23 Qwable-v1 · 80.3 · 2026-06-26 Grok 4.5 · 64.7 · 2026-07-08 Xiaomi-Robotics-U0 · 63.2 · 2026-07-17 Gemini 3.5 Flash-Lite · 54.2 · 2026-07-21 Gemini 3.5 Flash-Lite · 54.2 · 2026-07-21 Gemini 3.5 Flash-Lite · 54.2 · 2026-07-27 OpenForgeClaw · 31.7 · 2026-07-24 OpenForgeClaw · 55.9 · 2026-07-24 KAT-Coder-V2.5 · 65.2 · 2026-07-26 Qwen3.8-Max · 67.7 · 2026-08-03 Argus · 78 · 2026-08-06 Muse Glimmer · 51.2 · 2026-08-10 Ornith-1.5 · 65.1 · 2026-08-19
GPT-5.2 Thinking GPT-5.5 Claude Opus 4.7 Qwable-v1 Grok 4.5 Xiaomi-Robotics-U0 Gemini 3.5 Flash-Lite OpenForgeClaw KAT-Coder-V2.5 Qwen3.8-Max Argus Muse Glimmer Ornith-1.5
Cronología
Fecha Modelo Puntuación Fuente
2026-08-19 Ornith-1.5 65.1% Ornith-1.5 lanza modelos de 9B, 35B-A3B y 397B con entrenamiento de auto-mejora
2026-08-10 Muse Glimmer 51.2% Meta lanza Muse Glimmer, un modelo agente de pesos abiertos de 30B que funciona en una GPU para consumidores
2026-08-06 Argus 78.0% Argus: Un entorno de ejecución agénico de propósito general para razonamiento a largo plazo
2026-08-03 Qwen3.8-Max 67.7% Alibaba lanza Qwen3.8-Max, un modelo MoE de 2.4T parámetros
2026-07-27 Gemini 3.5 Flash-Lite 54.2% Google lanza Gemini 3.6 Flash, 3.5 Flash-Lite y 3.5 Flash Cyber
2026-07-26 KAT-Coder-V2.5 65.2% KwaiKAT lanza KAT-Coder-V2.5, un modelo de codificación agente entrenado en más de 100.000 entornos verificables
2026-07-24 OpenForgeClaw 55.9% OpenForgeRL permite el entrenamiento de extremo a extremo de agentes basados en arneses en cualquier entorno
2026-07-24 OpenForgeClaw 31.7% OpenForgeRL permite el entrenamiento de extremo a extremo de agentes basados en arneses en cualquier entorno
2026-07-21 Gemini 3.5 Flash-Lite 54.2% Google lanza Gemini 3.6 Flash, 3.5 Flash-Lite y 3.5 Flash Cyber para cargas de trabajo agénticas
2026-07-21 Gemini 3.5 Flash-Lite 54.2% Google lanza Gemini 3.6 Flash, 3.5 Flash-Lite y 3.5 Flash Cyber
2026-07-17 Xiaomi-Robotics-U0 63.2% Xiaomi lanza U0, un modelo de 38B parámetros para síntesis corporal unificada
2026-07-08 Grok 4.5 64.7% xAI lanza Grok 4.5 con bajo costo y rendimiento mixto en benchmarks
2026-06-26 Qwable-v1 80.3% Qwable-v1 lanzado como destilación de Claude Fable-5
2026-04-23 GPT-5.5 58.6% OpenAI lanza GPT-5.5 y GPT-5.5 Pro en la API
2026-04-23 GPT-5.5 58.6% OpenAI lanza GPT-5.5 con capacidades agénticas y duplica los precios de la API
2026-04-23 Claude Opus 4.7 64.3% OpenAI lanza GPT-5.5 con capacidades agénticas y duplica los precios de la API
2025-12-11 GPT-5.2 Thinking 55.6% OpenAI lanza GPT-5.2, superando a Gemini 3 en benchmarks de codificación y razonamiento
2025-12-11 GPT-5.2 Thinking 55.6% OpenAI presenta GPT-5.2 con capacidades de vanguardia para el trabajo profesional del conocimiento
2025-12-11 GPT-5.2 Thinking 55.6% OpenAI presenta GPT-5.2 con capacidades mejoradas de codificación, contexto largo y razonamiento