| 2026-09-09 |
Qwen Test agent + Repair agent (post-trained) |
72.6% |
ExecCritic utiliza RL específico por rol para mejorar agentes de codificación mediante reparación guiada por pruebas
|
| 2026-09-09 |
Qwen Test agent (post-trained) |
62.2% |
ExecCritic utiliza RL específico por rol para mejorar agentes de codificación mediante reparación guiada por pruebas
|
| 2026-09-09 |
GPT-5.6-sol (Test agent) |
65.3% |
ExecCritic utiliza RL específico por rol para mejorar agentes de codificación mediante reparación guiada por pruebas
|
| 2026-09-09 |
base Test agent (no-test baseline) |
57.3% |
ExecCritic utiliza RL específico por rol para mejorar agentes de codificación mediante reparación guiada por pruebas
|
| 2026-09-09 |
base Repair agent (no-test baseline) |
61.2% |
ExecCritic utiliza RL específico por rol para mejorar agentes de codificación mediante reparación guiada por pruebas
|
| 2026-09-09 |
Qwen Test agent (post-trained) + Repair agent (post-trained) |
72.6% |
ExecCritic utiliza RL específico por rol para mejorar agentes de codificación mediante reparación guiada por pruebas
|
| 2026-09-09 |
Qwen Test agent (post-trained) |
62.2% |
ExecCritic utiliza RL específico por rol para mejorar agentes de codificación mediante reparación guiada por pruebas
|
| 2026-09-09 |
GPT-5.6-sol (Test agent) |
65.3% |
ExecCritic utiliza RL específico por rol para mejorar agentes de codificación mediante reparación guiada por pruebas
|
| 2026-09-09 |
base Repair agent (no-test baseline) |
61.2% |
ExecCritic utiliza RL específico por rol para mejorar agentes de codificación mediante reparación guiada por pruebas
|
| 2026-09-09 |
base Test agent |
57.3% |
ExecCritic utiliza RL específico por rol para mejorar agentes de codificación mediante reparación guiada por pruebas
|
| 2026-09-07 |
K2-Horizon-7B |
70.6% |
IFM lanza K2 Horizon: seis modelos Apache 2.0 de 0.9B a 375B
|
| 2026-09-07 |
K2-Horizon-3.7B |
68.6% |
IFM lanza K2 Horizon: seis modelos Apache 2.0 de 0.9B a 375B
|
| 2026-09-02 |
Qwen3.5-9B |
16.6% |
CANOPY permite que Qwen3-14B encabece AppWorld usando RL solo con resultados
|
| 2026-08-26 |
Granite 4.2 30B |
57.0% |
IBM lanza Granite 4.2 con razonamiento nativo y RL agéntico para modelos empresariales abiertos
|
| 2026-08-26 |
Granite 4.2 8B |
47.67% |
IBM lanza Granite 4.2 con razonamiento nativo y RL agéntico para modelos empresariales abiertos
|
| 2026-08-20 |
Qwen3.5-9B |
14.6% |
Meta lanza Muse Video con audio nativo; Stripe adquiere OpenRouter
|
| 2026-08-20 |
Ornith-1.5 |
86.0% |
Z.ai propone una ley de escalado post-entrenamiento y lanza GLM 5.3; Ornith-1.5 se lanza con auto-mejora
|
| 2026-08-19 |
Ornith-1.5 |
86.0% |
Ornith-1.5 lanza modelos de 9B, 35B-A3B y 397B con entrenamiento de auto-mejora
|
| 2026-08-18 |
Qwen3.5-27B |
74.8% |
El agente Kozuchi resuelve 374 instancias de SWE-bench Verified usando Qwen3.5-27B
|
| 2026-08-10 |
Qwen3.6-27B |
77.2% |
Meta lanza Muse Glimmer, un modelo agente de pesos abiertos de 30B que funciona en una GPU para consumidores
|
| 2026-08-03 |
Orchard-SWE |
69.7% |
Microsoft Research lanza el framework Orchard para IA agente escalable
|
| 2026-08-03 |
Inkling-Small |
80.2% |
Thinking Machines Lab lanza Inkling-Small, un modelo MoE multimodal de pesos abiertos con 276B
|
| 2026-07-24 |
Claude Opus 5 |
96.0% |
Anthropic lanza Claude Opus 5 con pensamiento por defecto y mejoras en codificación agéntica
|
| 2026-07-19 |
DeepSeek V4 Pro |
80.6% |
Kimi K3, DeepSeek V4 Pro y GLM-5.2 comparados en benchmarks, licencia y costo de servicio
|
| 2026-07-17 |
Devstral Small 2 |
68.0% |
Mistral Vibe for Code lidera a cuatro agentes de codificación en la tarea de scaffold-a-PR
|
| 2026-07-17 |
Devstral 2 |
72.2% |
Mistral Vibe for Code lidera a cuatro agentes de codificación en la tarea de scaffold-a-PR
|
| 2026-07-14 |
Qwen3-30B-A3B |
6.0% |
UMoE reorganiza los conjuntos de expertos de MoE para un ajuste fino específico del dominio mejorado
|
| 2026-07-14 |
Qwen3.5-35B-A3B |
6.0% |
UMoE reorganiza los conjuntos de expertos de MoE para un ajuste fino específico del dominio mejorado
|
| 2026-07-07 |
LLM-as-a-Verifier |
78.2% |
LLM-as-a-Verifier presenta un marco de verificación de propósito general con puntuación continua
|
| 2026-06-28 |
LoopCoder-v2 |
64.4% |
LoopCoder-v2 logra el rendimiento óptimo en bucles anidados
|
| 2026-06-27 |
LoopCoder-V2 |
64.4% |
LoopCoder-V2: Modelo PLT de dos bucles logra la mejor relación ganancia-coste
|
| 2026-04-25 |
Qwen3.6-27B |
77.2% |
Alibaba lanza Qwen3.6-27B, superando al predecesor más grande en benchmarks de programación
|
| 2026-04-24 |
V4-Pro-Max |
80.6% |
DeepSeek lanza V4 con una arquitectura eficiente de contexto largo para agentes
|
| 2026-03-25 |
o3 |
71.7% |
OpenAI anuncia la retirada de o3 de ChatGPT y comparte puntuaciones de benchmarks
|
| 2026-02-17 |
Claude Sonnet 4.6 |
79.6% |
Anthropic lanza Claude Sonnet 4.6 con mejor codificación, uso de computadora y contexto de 1M de tokens
|
| 2026-02-05 |
Claude Opus 4.6 |
80.8% |
Anthropic lanza Claude Opus 4.6 con ventana de contexto de 1M y mejoras agénticas
|
| 2026-02-01 |
MiniMax M2.5 |
80.2% |
Los benchmarks descontaminados revelan una brecha de 12 puntos entre los principales modelos de codificación con IA
|
| 2026-02-01 |
Claude Opus 4.6 |
80.8% |
Los benchmarks descontaminados revelan una brecha de 12 puntos entre los principales modelos de codificación con IA
|
| 2026-01-28 |
Qwen3.6-27B |
77.2% |
Qwen 3.6-27B y DeepSeek V4 Flash lideran benchmarks de codificación local
|
| 2025-12-11 |
GPT-5.2 Thinking |
80.0% |
OpenAI lanza GPT-5.2, superando a Gemini 3 en benchmarks de codificación y razonamiento
|
| 2025-12-11 |
GPT-5.2 Thinking |
80.0% |
OpenAI presenta GPT-5.2 con capacidades de vanguardia para el trabajo profesional del conocimiento
|
| 2025-12-09 |
Devstral Small 2 |
68.0% |
Mistral lanza los modelos de codificación Devstral 2 y Mistral Vibe CLI
|
| 2025-12-09 |
Devstral 2 |
72.2% |
Mistral lanza los modelos de codificación Devstral 2 y Mistral Vibe CLI
|
| 2025-11-19 |
Kimi K2 Thinking |
71.3% |
Moonshot AI lanza Kimi K2 Thinking con uso de herramientas agénticas
|
| 2025-11-19 |
GPT-5.1-Codex-Max |
77.9% |
OpenAI establece GPT-5.1-Codex-Max como predeterminado en Codex CLI
|
| 2025-11-07 |
Kimi K2 Thinking |
71.3% |
Moonshot AI lanza Kimi K2 Thinking, un modelo de razonamiento de código abierto con 1T parámetros
|
| 2025-09-30 |
Claude Sonnet 4.5 |
77.2% |
Anthropic lanza Claude Sonnet 4.5 con capacidades mejoradas de codificación y agentes
|
| 2025-09-29 |
Claude Sonnet 4.5 |
77.2% |
Anthropic
|
| 2025-08-07 |
GPT-5 |
74.9% |
OpenAI lanza GPT-5 unificado con enrutamiento en tiempo real y acceso gratuito
|
| 2025-08-07 |
GPT-5 |
74.9% |
OpenAI presenta GPT-5 con enrutamiento unificado y razonamiento de nivel experto
|
| 2025-08-07 |
GPT‑5 |
74.9% |
OpenAI lanza la API de GPT-5 con mejoras en codificación y agentes
|
| 2025-08-07 |
GPT-5 |
74.9% |
OpenAI lanza GPT-5 con razonamiento adaptativo y arquitectura unificada
|
| 2025-08-07 |
GPT-5 |
74.9% |
OpenAI
|
| 2025-08-06 |
GLM-4.5 |
64.2% |
Zhipu AI lanza los modelos GLM-4.5 que igualan a Claude y DeepSeek
|
| 2025-07-28 |
Kimi K2 |
65.8% |
Kimi K2: modelo MoE abierto con 1T parámetros y optimizador MuonClip
|
| 2025-07-28 |
Kimi K2 |
65.8% |
Moonshot lanza Kimi K2, un modelo MoE agénico abierto con 32B de parámetros activados
|
| 2025-07-11 |
Kimi K2-Instruct |
65.8% |
Moonshot AI lanza Kimi-K2-Instruct, un modelo MoE de 1T parámetros con capacidades agénticas
|
| 2025-07-11 |
Kimi K2 |
65.8% |
Moonshot AI lanza Kimi K2, un modelo MoE de 1T parámetros con capacidades agénticas
|
| 2025-07-10 |
Devstral Small 1.1 |
53.6% |
Mistral AI lanza Devstral Small 1.1 y Devstral Medium con All Hands AI
|
| 2025-07-10 |
Devstral Medium |
61.6% |
Mistral AI lanza Devstral Small 1.1 y Devstral Medium con All Hands AI
|
| 2025-05-30 |
Deepseek-R1-0528 |
57.6% |
DeepSeek actualiza el modelo R1 con mejor razonamiento y puntuaciones en benchmarks
|
| 2025-05-23 |
Claude Opus 4 |
72.5% |
Anthropic lanza Claude Opus 4 y Sonnet 4 con razonamiento híbrido
|
| 2025-05-23 |
Claude Sonnet 4 |
72.7% |
Anthropic lanza Claude Opus 4 y Sonnet 4 con razonamiento híbrido
|
| 2025-05-22 |
Claude Opus 4 |
72.5% |
Anthropic
|
| 2025-05-21 |
Devstral |
46.8% |
Mistral AI lanza Devstral, un LLM agente para ingeniería de software
|
| 2025-04-17 |
o4-mini |
68.1% |
OpenAI lanza o4-mini, un modelo de razonamiento multimodal más rápido y económico
|
| 2025-04-16 |
OpenAI o3 |
71.7% |
OpenAI
|
| 2025-04-14 |
GPT‑4.1 |
54.6% |
OpenAI lanza GPT-4.1, GPT-4.1 mini y GPT-4.1 nano en la API
|
| 2025-04-14 |
GPT-4.1 |
54.6% |
OpenAI lanza la familia GPT-4.1 con contexto de 1M de tokens y mejoras en programación
|
| 2025-03-26 |
Gemini 2.5 Pro |
63.8% |
Google lanza el modelo de razonamiento experimental Gemini 2.5 Pro con contexto de 1M tokens
|
| 2025-03-25 |
Gemini 2.5 Pro |
63.8% |
Google presenta el modelo de pensamiento Gemini 2.5 Pro
|
| 2025-03-25 |
Gemini 2.5 Pro |
63.8% |
Google presenta el modelo experimental Gemini 2.5 Pro
|
| 2025-03-25 |
Gemini 2.5 Pro |
63.8% |
Google DeepMind
|
| 2025-03-05 |
GPT-4.5 |
38.0% |
OpenAI lanza GPT-4.5, su modelo más grande, para ChatGPT Plus
|
| 2025-02-24 |
Claude 3.7 Sonnet |
62.3% |
Anthropic
|
| 2025-01-06 |
Claude 3.5 Sonnet |
49.0% |
Claude 3.5 Sonnet alcanza el 49% en SWE-bench Verified
|
| 2024-12-20 |
o3 |
71.7% |
OpenAI presenta el modelo de razonamiento o3 con avances en ARC AGI y Frontier Math
|
| 2024-12-20 |
o3 |
71.7% |
OpenAI lanza el modelo o3 con alto rendimiento en razonamiento y programación
|
| 2024-10-30 |
Claude 3.5 Sonnet |
49.0% |
Claude 3.5 Sonnet alcanza el 49% en SWE-bench Verified con andamiaje mínimo de agente
|
| 2024-10-22 |
Claude 3.5 Haiku |
40.6% |
Anthropic actualiza Claude 3.5 Sonnet, lanza Claude 3.5 Haiku y la versión beta de uso del ordenador
|
| 2024-10-22 |
Claude 3.5 Sonnet |
49.0% |
Anthropic actualiza Claude 3.5 Sonnet, lanza Claude 3.5 Haiku y la versión beta de uso del ordenador
|
| 2024-10-22 |
Claude 3.5 Sonnet |
49.0% |
Anthropic
|
| 2024-08-13 |
Agentless |
32.0% |
OpenAI lanza SWE-bench Verified con un subconjunto validado por humanos
|
| 2024-08-13 |
GPT‑4o |
33.2% |
OpenAI lanza SWE-bench Verified con un subconjunto validado por humanos
|