| 2026-09-10 |
DeepSeek-V4.1-Flash |
74.2% |
DeepSeek lanza el modelo V4.1-Flash con soporte multimodal nativo
|
| 2026-09-04 |
GPT-6 Astra |
74.1% |
OpenAI lanza GPT-6 Astra, un modelo de uso informático con contexto de 1.05M
|
| 2026-09-04 |
Muse Spark 1.3 |
75.4% |
Meta lanza Muse Spark 1.3 con menos llamadas a herramientas y tokens
|
| 2026-08-26 |
GLM-5.3-Flash |
63.0% |
Ox Alpha es GLM-5.3-Flash
|
| 2026-08-22 |
GLM-5.3 |
69.0% |
GLM-5.3 iguala la precisión de Claude Fable 5 en DeepSWE con una quinta parte del costo
|
| 2026-08-22 |
Claude Fable 5 |
69.7% |
GLM-5.3 iguala la precisión de Claude Fable 5 en DeepSWE con una quinta parte del costo
|
| 2026-08-21 |
DeepSeek-V4-Flash-Vision-Exp |
59.3% |
DeepSeek lanza el modelo multimodal DeepSeek-V4-Flash-Vision-Exp
|
| 2026-08-20 |
Ornith-1.5 |
56.0% |
Z.ai propone una ley de escalado post-entrenamiento y lanza GLM 5.3; Ornith-1.5 se lanza con auto-mejora
|
| 2026-08-19 |
Ornith-1.5 |
56.0% |
Ornith-1.5 lanza modelos de 9B, 35B-A3B y 397B con entrenamiento de auto-mejora
|
| 2026-08-18 |
DeepSeek V4 Pro 0813 |
62.8% |
DeepSeek V4 Pro 0813 vs Claude Fable 5 en DeepSWE: Costo, codificación y enrutamiento
|
| 2026-08-18 |
Claude Fable 5 |
69.7% |
DeepSeek V4 Pro 0813 vs Claude Fable 5 en DeepSWE: Costo, codificación y enrutamiento
|
| 2026-08-18 |
GPT-5.6 Sol |
85.8% |
DeepSeek V4 Pro y GPT-5.6 Sol: la cascada resuelve el 83% de las tareas de DeepSWE por $3.35
|
| 2026-08-18 |
DeepSeek V4 Pro 0813 |
88.5% |
DeepSeek V4 Pro y GPT-5.6 Sol: la cascada resuelve el 83% de las tareas de DeepSWE por $3.35
|
| 2026-08-17 |
GLM-5.3 |
66.9% |
Z.ai lanza el modelo de codificación GLM-5.3; Cursor se une a SpaceXAI
|
| 2026-08-13 |
Gemini 3.7 Flash |
65.3% |
Google presenta Gemini 3.7 Flash con mejor codificación y menor costo
|
| 2026-08-13 |
DeepSeek-V4-Pro |
62.7% |
El lanzamiento GA de DeepSeek-V4-Pro mejora las capacidades del agente y añade soporte para la API de Respuestas
|
| 2026-08-13 |
Grok 4.6 |
65.9% |
SpaceXAI lanza Grok 4.6 con contexto de 500K y razonamiento agéntico mejorado
|
| 2026-08-07 |
DeepSeek-V4 Flash 0731 |
53.3% |
DeepSeek-V4 Flash 0731 vs GPT-5.6 Luna en DeepSWE: Costo y codificación
|
| 2026-08-07 |
GPT-5.6 Luna |
67.2% |
DeepSeek-V4 Flash 0731 vs GPT-5.6 Luna en DeepSWE: Costo y codificación
|
| 2026-08-03 |
Qwen3.8-Max |
56.6% |
Alibaba lanza Qwen3.8-Max, un modelo MoE de 2.4T parámetros
|
| 2026-07-31 |
DeepSeek-V4-Flash-0731 |
54.4% |
DeepSeek lanza V4-Flash-0731 con importantes mejoras agénticas a menor costo
|
| 2026-07-31 |
DeepSeek-V4-Flash |
54.4% |
DeepSeek lanza la versión beta pública de DeepSeek-V4-Flash con capacidades mejoradas de agente
|
| 2026-07-27 |
Gemini 3.6 Flash |
49.0% |
Google lanza Gemini 3.6 Flash, 3.5 Flash-Lite y 3.5 Flash Cyber
|
| 2026-07-27 |
Kimi K3 |
68.5% |
Kimi K3 supera a GPT-5.6 Sol en DeepSWE pass@4 y cuesta un 64% menos
|
| 2026-07-27 |
GPT-5.6 Sol |
72.7% |
Kimi K3 supera a GPT-5.6 Sol en DeepSWE pass@4 y cuesta un 64% menos
|