| 2026-09-11 |
GPT-6 Astra |
96.3% |
OpenAI lanza GPT-6 Astra, encabeza los rankings con menor costo
|
| 2026-09-10 |
DeepSeek-V4.1-Flash |
90.9% |
DeepSeek lanza el modelo V4.1-Flash con soporte multimodal nativo
|
| 2026-09-07 |
K2-Horizon-375B-A23B |
87.3% |
IFM lanza K2 Horizon: seis modelos Apache 2.0 de 0.9B a 375B
|
| 2026-08-28 |
GLM-5.3 |
91.72% |
Z.ai ajusta finamente GLM-5.3 para obtener ventajas en ciberseguridad
|
| 2026-08-25 |
QAH model (GPT-OSS 120B compressed to 60B, MXFP4) |
67.4% |
La QAH de Multiverse Computing hace que GPT-OSS de 4 bits supere a su versión original de precisión completa
|
| 2026-08-21 |
Grok 4.6 |
94.9% |
SpaceXAI presenta Grok 4.6 con datos de Cursor para trabajo agéntico
|
| 2026-08-03 |
Qwen3.8-Max |
92.6% |
Alibaba lanza Qwen3.8-Max, un modelo MoE de 2.4T parámetros
|
| 2026-08-03 |
Inkling-Small |
89.5% |
Thinking Machines Lab lanza Inkling-Small, un modelo MoE multimodal de pesos abiertos con 276B
|
| 2026-07-17 |
Kimi K3 |
93.5% |
Moonshot AI lanza Kimi K3 abierto, un modelo MoE de 2.8T parámetros con contexto de 1M
|
| 2026-07-17 |
GPT-Live-1 |
84.2% |
OpenAI lanza modelos de voz full-dúplex y un tribunal alemán considera responsable a Google por las Resúmenes de IA
|
| 2026-03-25 |
o3 |
87.7% |
OpenAI anuncia la retirada de o3 de ChatGPT y comparte puntuaciones de benchmarks
|
| 2026-02-25 |
Grok 4 |
87.7% |
xAI lanza el modelo de razonamiento Grok 4 con fuertes benchmarks agénticos y de codificación
|
| 2026-02-05 |
Claude Opus 4.6 |
91.3% |
Anthropic lanza Claude Opus 4.6 con ventana de contexto de 1M y mejoras agénticas
|
| 2026-01-27 |
Kimi K2.5 |
87.6% |
Moonshot lanza Kimi K2.5 con tecnología Agent Swarm
|
| 2025-12-11 |
GPT-5.2 Thinking |
92.4% |
OpenAI lanza los modelos GPT-5.2 Pro y Thinking para ciencia y matemáticas
|
| 2025-12-11 |
GPT-5.2 Pro |
93.2% |
OpenAI presenta GPT-5.2 con capacidades mejoradas de codificación, contexto largo y razonamiento
|
| 2025-12-11 |
GPT-5.2 Pro |
93.2% |
OpenAI lanza los modelos GPT-5.2 Pro y Thinking para ciencia y matemáticas
|
| 2025-12-11 |
GPT-5.2 Thinking |
92.4% |
OpenAI presenta GPT-5.2 con capacidades mejoradas de codificación, contexto largo y razonamiento
|
| 2025-12-04 |
Gemini 3 Pro |
93.0% |
Epoch AI lanza el Hub de Centros de Datos Fronterizos y analiza la benchmark OSWorld
|
| 2025-11-18 |
Gemini 3 Deep Think |
93.8% |
Google lanza Gemini 3 Pro con capacidades de razonamiento y multimodales de última generación
|
| 2025-11-18 |
Gemini 3 Deep Think |
93.8% |
Google lanza Gemini 3 Pro con capacidades de razonamiento y multimodales de última generación
|
| 2025-11-18 |
Gemini 3 Pro |
91.9% |
Google lanza Gemini 3 Pro con capacidades de razonamiento y multimodales de última generación
|
| 2025-11-18 |
Gemini 3 Pro |
91.9% |
Google lanza Gemini 3 Pro con capacidades de razonamiento y multimodales de última generación
|
| 2025-10-24 |
O1 |
77.0% |
Benchmark GPQA-Diamond: Puntuaciones, tabla de clasificación y comparación de modelos de IA
|
| 2025-10-24 |
Claude Opus 4.6 |
91.3% |
Benchmark GPQA-Diamond: Puntuaciones, tabla de clasificación y comparación de modelos de IA
|
| 2025-10-24 |
GPT-5.2 |
92.4% |
Benchmark GPQA-Diamond: Puntuaciones, tabla de clasificación y comparación de modelos de IA
|
| 2025-10-24 |
Gemini 3 Pro |
91.9% |
Benchmark GPQA-Diamond: Puntuaciones, tabla de clasificación y comparación de modelos de IA
|
| 2025-10-24 |
Aristotle-X1 |
92.4% |
Benchmark GPQA-Diamond: Puntuaciones, tabla de clasificación y comparación de modelos de IA
|
| 2025-10-24 |
Gemini 3.1 Pro Preview |
94.1% |
Benchmark GPQA-Diamond: Puntuaciones, tabla de clasificación y comparación de modelos de IA
|
| 2025-10-24 |
GPT-4 |
39.0% |
Benchmark GPQA-Diamond: Puntuaciones, tabla de clasificación y comparación de modelos de IA
|
| 2025-10-24 |
Claude 3 Opus |
60.0% |
Benchmark GPQA-Diamond: Puntuaciones, tabla de clasificación y comparación de modelos de IA
|
| 2025-09-30 |
Claude Sonnet 4.5 |
83.4% |
Anthropic lanza Claude Sonnet 4.5 con capacidades mejoradas de codificación y agentes
|
| 2025-09-22 |
DeepSeek-V3.1-Terminus |
74.24% |
DeepSeek lanza DeepSeek-V3.1-Terminus con correcciones de idioma y agentes
|
| 2025-08-07 |
GPT-5 pro |
89.4% |
OpenAI lanza GPT-5 unificado con enrutamiento en tiempo real y acceso gratuito
|
| 2025-08-07 |
GPT-5 pro |
88.4% |
OpenAI presenta GPT-5 con enrutamiento unificado y razonamiento de nivel experto
|
| 2025-08-07 |
GPT-5 Pro |
88.4% |
OpenAI lanza GPT-5 con razonamiento adaptativo y arquitectura unificada
|
| 2025-07-28 |
Kimi K2 |
75.1% |
Kimi K2: modelo MoE abierto con 1T parámetros y optimizador MuonClip
|
| 2025-07-28 |
Kimi K2 |
75.1% |
Moonshot lanza Kimi K2, un modelo MoE agénico abierto con 32B de parámetros activados
|
| 2025-05-30 |
Deepseek-R1-0528 |
81.0% |
DeepSeek actualiza el modelo R1 con mejor razonamiento y puntuaciones en benchmarks
|
| 2025-05-22 |
Claude Opus 4 |
74.9% |
Anthropic lanza Claude Opus 4 y Sonnet 4 con medidas de seguridad ASL-3
|
| 2025-05-22 |
Claude Opus 4 |
74.9% |
Anthropic presenta Claude Opus 4 y Sonnet 4 con pensamiento extendido y uso de herramientas
|
| 2025-05-22 |
Claude Sonnet 4 |
70.0% |
Anthropic presenta Claude Opus 4 y Sonnet 4 con pensamiento extendido y uso de herramientas
|
| 2025-04-16 |
OpenAI o3 |
87.7% |
OpenAI
|
| 2025-04-15 |
Gemini 2.0 Flash |
60.1% |
Google lanza Gemini 2.0 Flash con calidad mejorada y el doble de velocidad que Gemini 1.5 Pro
|
| 2025-04-14 |
GPT‑4.1 nano |
50.3% |
OpenAI lanza GPT-4.1, GPT-4.1 mini y GPT-4.1 nano en la API
|
| 2025-04-10 |
Seed1.5-Thinking |
77.3% |
Seed1.5-Thinking utiliza aprendizaje por refuerzo para mejorar el razonamiento
|
| 2025-04-05 |
Gemini 2.5 Pro |
84.0% |
Google amplía el acceso a Gemini 2.5 Pro ante sólidos resultados en benchmarks
|
| 2025-03-26 |
Gemini 2.5 Pro |
84.0% |
Google lanza el modelo de razonamiento experimental Gemini 2.5 Pro con contexto de 1M tokens
|
| 2025-03-25 |
Gemini 2.5 Pro (experimental) |
84.0% |
Google DeepMind lanza el modelo experimental Gemini 2.5 Pro
|
| 2025-03-25 |
Gemini 2.5 Pro |
84.0% |
Google DeepMind
|
| 2025-03-24 |
DeepSeek-V3-0324 |
68.4% |
DeepSeek-V3-0324 mejora el razonamiento, la programación y la escritura en chino respecto a DeepSeek-V3
|
| 2025-03-11 |
Grok 3 |
84.6% |
xAI lanza Grok 3 con razonamiento profundo y contexto de un millón de tokens
|
| 2025-03-05 |
GPT-4.5 |
71.4% |
OpenAI lanza GPT-4.5, su modelo más grande, para ChatGPT Plus
|
| 2025-02-26 |
Claude 3.5 Sonnet |
65.0% |
Comparativa de benchmarks entre Claude 3.7 Sonnet, o3-mini, R1 y Grok 3 Beta
|
| 2025-02-26 |
Claude 3.7 Sonnet |
84.8% |
Comparativa de benchmarks entre Claude 3.7 Sonnet, o3-mini, R1 y Grok 3 Beta
|
| 2025-02-26 |
Grok 3 Beta |
84.6% |
Comparativa de benchmarks entre Claude 3.7 Sonnet, o3-mini, R1 y Grok 3 Beta
|
| 2025-02-26 |
DeepSeek R1 |
71.5% |
Comparativa de benchmarks entre Claude 3.7 Sonnet, o3-mini, R1 y Grok 3 Beta
|
| 2025-02-26 |
OpenAI o3-mini |
78.0% |
Comparativa de benchmarks entre Claude 3.7 Sonnet, o3-mini, R1 y Grok 3 Beta
|
| 2025-02-24 |
Claude 3.7 Sonnet |
84.8% |
Anthropic lanza Claude 3.7 Sonnet con control dinámico de razonamiento
|
| 2025-02-19 |
Grok 3 (Think) |
84.6% |
xAI lanza Grok 3 Beta y el agente DeepSearch
|
| 2024-12-20 |
o3 |
87.7% |
OpenAI lanza el modelo o3 con alto rendimiento en razonamiento y programación
|
| 2024-11-28 |
QwQ-32B-Preview |
65.2% |
Qwen lanza QwQ-32B-Preview, un modelo de razonamiento experimental
|
| 2024-07-15 |
Qwen2-72B |
37.9% |
El equipo de Qwen lanza la serie Qwen2 con modelos densos y MoE de 72B
|
| 2024-07-15 |
Qwen2-72B |
37.9% |
El informe técnico de Qwen2 presenta modelos densos y MoE de hasta 72B
|
| 2024-06-20 |
Claude 3.5 Sonnet |
59.4% |
Anthropic lanza un apéndice de Claude 3.5 Sonnet con mejores benchmarks de codificación y visión
|
| 2024-06-20 |
Claude 3.5 Sonnet |
59.4% |
Anthropic
|
| 2023-11-20 |
GPT-4 based baseline |
39.0% |
GPQA: Un conjunto de preguntas y respuestas a nivel de posgrado, a prueba de Google
|