Benchmark · reasoning

GPQA Diamond

61 resultados 44 modelos

GPQA Diamond es el subconjunto más difícil de GPQA, un conjunto de preguntas de opción múltiple de nivel de posgrado y «a prueba de Google» sobre biología, física y química escritas por expertos. El modelo se evalúa por su porcentaje de acierto al elegir la respuesta correcta.

Leer más
Ejemplo
Un ítem típico es una pregunta difícil de opción múltiple que exige razonamiento de nivel de posgrado; por ejemplo, una pregunta de química que describe un mecanismo de reacción y pide cuál de las cuatro opciones da el producto correcto, tan difícil que un no experto no la resuelve ni con búsquedas en la web.
Puntuación
La puntuación es el porcentaje de preguntas contestadas correctamente (exactitud): el número de ítems en los que el modelo elige la opción correcta dividido entre el total de preguntas.
Verificación
Cada respuesta se califica automáticamente por coincidencia exacta con la única opción correcta conocida, sin necesidad de juicio humano; la propia etiqueta «Diamond» se asignó al crear el conjunto de datos, cuando expertos cualificados coincidían en la respuesta y los no expertos aun así fallaban.
Por qué importa
Es una de las pruebas más exigentes de verdadero razonamiento científico de nivel experto (no de datos que se pueden buscar), por lo que una puntuación alta en GPQA Diamond es una señal destacada de que un modelo de frontera puede razonar sobre problemas difíciles y especializados.
Ejemplo resuelto
Tarea
Un electrón está en el estado de espín (sin normalizar) (3i, 4)ᵀ. Halla el valor esperado de su espín a lo largo del eje y, S_y. Opciones: (A) 12ħ/25 (B) −12ħ/25 (C) 25ħ/2 (D) −25ħ/2.
Solución
Norm: |3i|²+|4|²=25. σ_y=[[0,−i],[i,0]]. ⟨S_y⟩=(ħ/2)·(ψ†σ_yψ)/(ψ†ψ)=(ħ/2)·(−24/25)=−12ħ/25 → (B).
Explicación
Con ⟨S_y⟩ = ψ†S_yψ / ψ†ψ y S_y = (ħ/2)σ_y, el numerador ψ†σ_yψ = −24 y la norma ψ†ψ = 25, dando −12ħ/25 (opción B). GPQA califica por coincidencia exacta de la letra elegida con la clave correcta.
0 25 50 75 100 2023-11-20 2025-03-27 2026-08-03 GPT-4 based baseline · 39 · 2023-11-20 Claude 3.5 Sonnet · 59.4 · 2024-06-20 Claude 3.5 Sonnet · 59.4 · 2024-06-20 Claude 3.5 Sonnet · 65 · 2025-02-26 Qwen2-72B · 37.9 · 2024-07-15 Qwen2-72B · 37.9 · 2024-07-15 QwQ-32B-Preview · 65.2 · 2024-11-28 o3 · 87.7 · 2024-12-20 o3 · 87.7 · 2026-03-25 Grok 3 (Think) · 84.6 · 2025-02-19 Claude 3.7 Sonnet · 84.8 · 2025-02-24 Claude 3.7 Sonnet · 84.8 · 2025-02-26 Grok 3 Beta · 84.6 · 2025-02-26 DeepSeek R1 · 71.5 · 2025-02-26 OpenAI o3-mini · 78 · 2025-02-26 GPT-4.5 · 71.4 · 2025-03-05 Grok 3 · 84.6 · 2025-03-11 DeepSeek-V3-0324 · 68.4 · 2025-03-24 Gemini 2.5 Pro (experimental) · 84 · 2025-03-25 Gemini 2.5 Pro · 84 · 2025-03-25 Gemini 2.5 Pro · 84 · 2025-03-26 Gemini 2.5 Pro · 84 · 2025-04-05 Seed1.5-Thinking · 77.3 · 2025-04-10 GPT‑4.1 nano · 50.3 · 2025-04-14 Gemini 2.0 Flash · 60.1 · 2025-04-15 Claude Sonnet 4 · 70 · 2025-05-22 Claude Opus 4 · 74.9 · 2025-05-22 Claude Opus 4 · 74.9 · 2025-05-22 Deepseek-R1-0528 · 81 · 2025-05-30 Kimi K2 · 75.1 · 2025-07-28 Kimi K2 · 75.1 · 2025-07-28 GPT-5 pro · 88.4 · 2025-08-07 GPT-5 pro · 89.4 · 2025-08-07 GPT-5 Pro · 88.4 · 2025-08-07 DeepSeek-V3.1-Terminus · 74.2 · 2025-09-22 Claude Sonnet 4.5 · 83.4 · 2025-09-30 GPT-5.2 · 92.4 · 2025-10-24 GPT-4 · 39 · 2025-10-24 Claude 3 Opus · 60 · 2025-10-24 O1 · 77 · 2025-10-24 Claude Opus 4.6 · 91.3 · 2025-10-24 Claude Opus 4.6 · 91.3 · 2026-02-05 Gemini 3 Pro · 91.9 · 2025-10-24 Gemini 3 Pro · 91.9 · 2025-11-18 Gemini 3 Pro · 91.9 · 2025-11-18 Gemini 3 Pro · 93 · 2025-12-04 Gemini 3.1 Pro Preview · 94.1 · 2025-10-24 Aristotle-X1 · 92.4 · 2025-10-24 Gemini 3 Deep Think · 93.8 · 2025-11-18 Gemini 3 Deep Think · 93.8 · 2025-11-18 GPT-5.2 Thinking · 92.4 · 2025-12-11 GPT-5.2 Thinking · 92.4 · 2025-12-11 GPT-5.2 Pro · 93.2 · 2025-12-11 GPT-5.2 Pro · 93.2 · 2025-12-11 Kimi K2.5 · 87.6 · 2026-01-27 Grok 4 · 87.7 · 2026-02-25 GPT-Live-1 · 84.2 · 2026-07-17 Kimi K3 · 93.5 · 2026-07-17 Inkling-Small · 89.5 · 2026-08-03 Qwen3.8-Max · 92.6 · 2026-08-03 OpenAI o3 · 87.7 · 2025-04-16
GPT-4 based baseline Claude 3.5 Sonnet Qwen2-72B QwQ-32B-Preview o3 Grok 3 (Think) Claude 3.7 Sonnet Grok 3 Beta DeepSeek R1 OpenAI o3-mini GPT-4.5 Grok 3 DeepSeek-V3-0324 Gemini 2.5 Pro (experimental) Gemini 2.5 Pro Seed1.5-Thinking GPT‑4.1 nano Gemini 2.0 Flash Claude Sonnet 4 Claude Opus 4 Deepseek-R1-0528 Kimi K2 GPT-5 pro GPT-5 Pro DeepSeek-V3.1-Terminus Claude Sonnet 4.5 GPT-5.2 GPT-4 Claude 3 Opus O1 Claude Opus 4.6 Gemini 3 Pro Gemini 3.1 Pro Preview Aristotle-X1 Gemini 3 Deep Think GPT-5.2 Thinking GPT-5.2 Pro Kimi K2.5 Grok 4 GPT-Live-1 Kimi K3 Inkling-Small Qwen3.8-Max OpenAI o3
Cronología
Fecha Modelo Puntuación Fuente
2026-08-03 Qwen3.8-Max 92.6% Alibaba lanza Qwen3.8-Max, un modelo MoE de 2.4T parámetros
2026-08-03 Inkling-Small 89.5% Thinking Machines Lab lanza Inkling-Small, un modelo MoE multimodal de pesos abiertos con 276B
2026-07-17 Kimi K3 93.5% Moonshot AI lanza Kimi K3 abierto, un modelo MoE de 2.8T parámetros con contexto de 1M
2026-07-17 GPT-Live-1 84.2% OpenAI lanza modelos de voz full-dúplex y un tribunal alemán considera responsable a Google por las Resúmenes de IA
2026-03-25 o3 87.7% OpenAI anuncia la retirada de o3 de ChatGPT y comparte puntuaciones de benchmarks
2026-02-25 Grok 4 87.7% xAI lanza el modelo de razonamiento Grok 4 con fuertes benchmarks agénticos y de codificación
2026-02-05 Claude Opus 4.6 91.3% Anthropic lanza Claude Opus 4.6 con ventana de contexto de 1M y mejoras agénticas
2026-01-27 Kimi K2.5 87.6% Moonshot lanza Kimi K2.5 con tecnología Agent Swarm
2025-12-11 GPT-5.2 Thinking 92.4% OpenAI presenta GPT-5.2 con capacidades mejoradas de codificación, contexto largo y razonamiento
2025-12-11 GPT-5.2 Thinking 92.4% OpenAI lanza los modelos GPT-5.2 Pro y Thinking para ciencia y matemáticas
2025-12-11 GPT-5.2 Pro 93.2% OpenAI lanza los modelos GPT-5.2 Pro y Thinking para ciencia y matemáticas
2025-12-11 GPT-5.2 Pro 93.2% OpenAI presenta GPT-5.2 con capacidades mejoradas de codificación, contexto largo y razonamiento
2025-12-04 Gemini 3 Pro 93.0% Epoch AI lanza el Hub de Centros de Datos Fronterizos y analiza la benchmark OSWorld
2025-11-18 Gemini 3 Pro 91.9% Google lanza Gemini 3 Pro con capacidades de razonamiento y multimodales de última generación
2025-11-18 Gemini 3 Deep Think 93.8% Google lanza Gemini 3 Pro con capacidades de razonamiento y multimodales de última generación
2025-11-18 Gemini 3 Pro 91.9% Google lanza Gemini 3 Pro con capacidades de razonamiento y multimodales de última generación
2025-11-18 Gemini 3 Deep Think 93.8% Google lanza Gemini 3 Pro con capacidades de razonamiento y multimodales de última generación
2025-10-24 GPT-5.2 92.4% Benchmark GPQA-Diamond: Puntuaciones, tabla de clasificación y comparación de modelos de IA
2025-10-24 GPT-4 39.0% Benchmark GPQA-Diamond: Puntuaciones, tabla de clasificación y comparación de modelos de IA
2025-10-24 Claude 3 Opus 60.0% Benchmark GPQA-Diamond: Puntuaciones, tabla de clasificación y comparación de modelos de IA
2025-10-24 O1 77.0% Benchmark GPQA-Diamond: Puntuaciones, tabla de clasificación y comparación de modelos de IA
2025-10-24 Claude Opus 4.6 91.3% Benchmark GPQA-Diamond: Puntuaciones, tabla de clasificación y comparación de modelos de IA
2025-10-24 Gemini 3 Pro 91.9% Benchmark GPQA-Diamond: Puntuaciones, tabla de clasificación y comparación de modelos de IA
2025-10-24 Gemini 3.1 Pro Preview 94.1% Benchmark GPQA-Diamond: Puntuaciones, tabla de clasificación y comparación de modelos de IA
2025-10-24 Aristotle-X1 92.4% Benchmark GPQA-Diamond: Puntuaciones, tabla de clasificación y comparación de modelos de IA
2025-09-30 Claude Sonnet 4.5 83.4% Anthropic lanza Claude Sonnet 4.5 con capacidades mejoradas de codificación y agentes
2025-09-22 DeepSeek-V3.1-Terminus 74.24% DeepSeek lanza DeepSeek-V3.1-Terminus con correcciones de idioma y agentes
2025-08-07 GPT-5 pro 88.4% OpenAI presenta GPT-5 con enrutamiento unificado y razonamiento de nivel experto
2025-08-07 GPT-5 Pro 88.4% OpenAI lanza GPT-5 con razonamiento adaptativo y arquitectura unificada
2025-08-07 GPT-5 pro 89.4% OpenAI lanza GPT-5 unificado con enrutamiento en tiempo real y acceso gratuito
2025-07-28 Kimi K2 75.1% Kimi K2: modelo MoE abierto con 1T parámetros y optimizador MuonClip
2025-07-28 Kimi K2 75.1% Moonshot lanza Kimi K2, un modelo MoE agénico abierto con 32B de parámetros activados
2025-05-30 Deepseek-R1-0528 81.0% DeepSeek actualiza el modelo R1 con mejor razonamiento y puntuaciones en benchmarks
2025-05-22 Claude Sonnet 4 70.0% Anthropic presenta Claude Opus 4 y Sonnet 4 con pensamiento extendido y uso de herramientas
2025-05-22 Claude Opus 4 74.9% Anthropic lanza Claude Opus 4 y Sonnet 4 con medidas de seguridad ASL-3
2025-05-22 Claude Opus 4 74.9% Anthropic presenta Claude Opus 4 y Sonnet 4 con pensamiento extendido y uso de herramientas
2025-04-16 OpenAI o3 87.7% OpenAI
2025-04-15 Gemini 2.0 Flash 60.1% Google lanza Gemini 2.0 Flash con calidad mejorada y el doble de velocidad que Gemini 1.5 Pro
2025-04-14 GPT‑4.1 nano 50.3% OpenAI lanza GPT-4.1, GPT-4.1 mini y GPT-4.1 nano en la API
2025-04-10 Seed1.5-Thinking 77.3% Seed1.5-Thinking utiliza aprendizaje por refuerzo para mejorar el razonamiento
2025-04-05 Gemini 2.5 Pro 84.0% Google amplía el acceso a Gemini 2.5 Pro ante sólidos resultados en benchmarks
2025-03-26 Gemini 2.5 Pro 84.0% Google lanza el modelo de razonamiento experimental Gemini 2.5 Pro con contexto de 1M tokens
2025-03-25 Gemini 2.5 Pro (experimental) 84.0% Google DeepMind lanza el modelo experimental Gemini 2.5 Pro
2025-03-25 Gemini 2.5 Pro 84.0% Google DeepMind
2025-03-24 DeepSeek-V3-0324 68.4% DeepSeek-V3-0324 mejora el razonamiento, la programación y la escritura en chino respecto a DeepSeek-V3
2025-03-11 Grok 3 84.6% xAI lanza Grok 3 con razonamiento profundo y contexto de un millón de tokens
2025-03-05 GPT-4.5 71.4% OpenAI lanza GPT-4.5, su modelo más grande, para ChatGPT Plus
2025-02-26 Claude 3.7 Sonnet 84.8% Comparativa de benchmarks entre Claude 3.7 Sonnet, o3-mini, R1 y Grok 3 Beta
2025-02-26 Grok 3 Beta 84.6% Comparativa de benchmarks entre Claude 3.7 Sonnet, o3-mini, R1 y Grok 3 Beta
2025-02-26 DeepSeek R1 71.5% Comparativa de benchmarks entre Claude 3.7 Sonnet, o3-mini, R1 y Grok 3 Beta
2025-02-26 OpenAI o3-mini 78.0% Comparativa de benchmarks entre Claude 3.7 Sonnet, o3-mini, R1 y Grok 3 Beta
2025-02-26 Claude 3.5 Sonnet 65.0% Comparativa de benchmarks entre Claude 3.7 Sonnet, o3-mini, R1 y Grok 3 Beta
2025-02-24 Claude 3.7 Sonnet 84.8% Anthropic lanza Claude 3.7 Sonnet con control dinámico de razonamiento
2025-02-19 Grok 3 (Think) 84.6% xAI lanza Grok 3 Beta y el agente DeepSearch
2024-12-20 o3 87.7% OpenAI lanza el modelo o3 con alto rendimiento en razonamiento y programación
2024-11-28 QwQ-32B-Preview 65.2% Qwen lanza QwQ-32B-Preview, un modelo de razonamiento experimental
2024-07-15 Qwen2-72B 37.9% El equipo de Qwen lanza la serie Qwen2 con modelos densos y MoE de 72B
2024-07-15 Qwen2-72B 37.9% El informe técnico de Qwen2 presenta modelos densos y MoE de hasta 72B
2024-06-20 Claude 3.5 Sonnet 59.4% Anthropic lanza un apéndice de Claude 3.5 Sonnet con mejores benchmarks de codificación y visión
2024-06-20 Claude 3.5 Sonnet 59.4% Anthropic
2023-11-20 GPT-4 based baseline 39.0% GPQA: Un conjunto de preguntas y respuestas a nivel de posgrado, a prueba de Google