Benchmark · reasoning

Humanity's Last Exam

32 resultados 24 modelos

Humanity's Last Exam (HLE) es un benchmark de preguntas expertas de frontera que abarcan muchos dominios académicos (matemáticas, ciencias, humanidades y más), diseñado deliberadamente para ser extremadamente difícil para la IA. Reporta el rendimiento como porcentaje de aciertos (accuracy).

Leer más
Ejemplo
Cada ítem es una pregunta experta de respuesta cerrada con una única respuesta correcta; por ejemplo, un problema avanzado de matemáticas o una pregunta científica de nivel de posgrado (algunas con una imagen adjunta), planteada como opción múltiple o como respuesta corta exacta.
Puntuación
La métrica es la exactitud (accuracy): el porcentaje de preguntas que el modelo responde correctamente. Algunas versiones también reportan una medida de calibración (confianza) junto con la exactitud.
Verificación
Cada pregunta tiene una respuesta correcta conocida, y la respuesta del modelo se califica automáticamente contra esa referencia (la opción correcta en las de opción múltiple, una respuesta corta coincidente): calificación automática y objetiva, no por voto humano.
Por qué importa
Los benchmarks habituales se han saturado (los mejores modelos rozan el techo), así que HLE busca ser una prueba difícil y discriminante en la frontera del conocimiento experto humano, un indicador significativo de cuán lejos está la IA del razonamiento a nivel de experto.
Ejemplo resuelto
Tarea
Los colibríes (orden Apodiformes) poseen de forma única un hueso sesamoideo (sesamoid) oval y bilateralmente pareado, incrustado en la parte caudolateral de la aponeurosis (aponeurosis) cruciforme expandida de inserción del m. depressor caudae. ¿Cuántos tendones pareados sostiene este hueso sesamoideo? Responde con un único número entero.
Solución
4
Explicación
El hueso sesamoideo oval se forma dentro de la aponeurosis cruciforme del músculo depresor de la cola y sostiene cuatro tendones pareados de esa inserción, una osificación especializada exclusiva de la anatomía caudal de los colibríes. HLE califica la respuesta por coincidencia exacta del número entero enviado con la respuesta de referencia (4) y solicita por separado una confianza para la calibración.
0 16 32 48 64 2025-01-23 2025-11-02 2026-08-13 the model powering deep research · 26.6 · 2025-02-02 Gemini 2.5 Pro (experimental) · 18.8 · 2025-03-25 Gemini 2.5 Pro · 18.8 · 2025-03-25 Gemini 2.5 Pro · 18.8 · 2025-03-25 Gemini 2.5 Pro · 18.8 · 2025-03-26 Gemini 2.5 Pro · 18.8 · 2025-04-05 Grok 4 Heavy · 50.7 · 2025-07-09 GPT-5 Pro · 42 · 2025-08-07 Tongyi DeepResearch · 32.9 · 2025-09-16 DeepSeek-V3.2-Exp · 56.5 · 2025-09-29 Kimi K2 Thinking · 44.9 · 2025-11-07 MiroThinker v1.0 (72B variant) · 37.7 · 2025-11-14 Gemini 3 Pro · 37.5 · 2025-11-18 Gemini 3 Pro · 37.5 · 2025-11-18 Gemini 3 Deep Think · 41 · 2025-11-18 Gemini 3 Deep Think · 41 · 2025-11-18 Gemini 3 Deep Think · 48.4 · 2026-02-12 Kimi K2.5 · 51.8 · 2026-01-29 Claude Opus 4.6 · 53 · 2026-02-05 Claude Opus 4.6 · 40 · 2026-02-05 Claude Opus 4.6 · 53 · 2026-03-06 Claude Opus 4.7 · 46.9 · 2026-04-25 GPT-5.5 · 41.4 · 2026-04-25 Claude Fable 5 · 53 · 2026-06-09 Agents-A1 · 47.6 · 2026-06-30 Claude Opus 4.8 · 46 · 2026-07-01 PoTRE · 49.9 · 2026-07-23 Inkling-Small · 31.6 · 2026-08-03 DeepSeek-V4-Pro · 60 · 2026-08-13 DeepSeek R1 (text-only) · 9.4 · 2025-01-23 Grok 4 · 25.4 · 2025-07-09 GPT-5 · 24.8 · 2025-08-07
the model powering deep research Gemini 2.5 Pro (experimental) Gemini 2.5 Pro Grok 4 Heavy GPT-5 Pro Tongyi DeepResearch DeepSeek-V3.2-Exp Kimi K2 Thinking MiroThinker v1.0 (72B variant) Gemini 3 Pro Gemini 3 Deep Think Kimi K2.5 Claude Opus 4.6 Claude Opus 4.7 GPT-5.5 Claude Fable 5 Agents-A1 Claude Opus 4.8 PoTRE Inkling-Small DeepSeek-V4-Pro DeepSeek R1 (text-only) Grok 4 GPT-5
Cronología
Fecha Modelo Puntuación Fuente
2026-08-13 DeepSeek-V4-Pro 60.0% El lanzamiento GA de DeepSeek-V4-Pro mejora las capacidades del agente y añade soporte para la API de Respuestas
2026-08-03 Inkling-Small 31.6% Thinking Machines Lab lanza Inkling-Small, un modelo MoE multimodal de pesos abiertos con 276B
2026-07-23 PoTRE 49.92% PoTRE presenta un marco de agentes múltiples heterogéneo para el razonamiento en tiempo de prueba
2026-07-01 Claude Opus 4.8 46.0% Anthropic lanza Claude Opus 4.8 con razonamiento adaptativo y mayor honestidad
2026-06-30 Agents-A1 47.6pts Escalar el horizonte, no los parámetros: alcanzar rendimiento de billones de parámetros con un agente de 35B
2026-06-09 Claude Fable 5 53.0% Claude Fable 5 se lanza en el puesto #1 del Índice de Inteligencia de Artificial Analysis
2026-04-25 Claude Opus 4.7 46.9% OpenAI lanza GPT-5.5, un modelo reentrenado desde cero con procesamiento omnimodal nativo
2026-04-25 GPT-5.5 41.4% OpenAI lanza GPT-5.5, un modelo reentrenado desde cero con procesamiento omnimodal nativo
2026-03-06 Claude Opus 4.6 53.0% Anthropic publica la tarjeta del sistema de Claude Opus 4.6 detallando capacidades y evaluaciones de seguridad
2026-02-12 Gemini 3 Deep Think 48.4% Google lanza Gemini 3 Deep Think mejorado con nuevas puntuaciones de benchmarks
2026-02-05 Claude Opus 4.6 53.0% Anthropic publica la tarjeta del sistema de Claude Opus 4.6 detallando capacidades y evaluaciones de seguridad
2026-02-05 Claude Opus 4.6 40.0% Anthropic lanza Claude Opus 4.6 con ventana de contexto de 1M y mejoras agénticas
2026-01-29 Kimi K2.5 51.8% Moonshot lanza el modelo agénico multimodal Kimi K2.5
2025-11-18 Gemini 3 Pro 37.5% Google lanza Gemini 3 Pro con capacidades de razonamiento y multimodales de última generación
2025-11-18 Gemini 3 Deep Think 41.0% Google lanza Gemini 3 Pro con capacidades de razonamiento y multimodales de última generación
2025-11-18 Gemini 3 Pro 37.5% Google lanza Gemini 3 Pro con capacidades de razonamiento y multimodales de última generación
2025-11-18 Gemini 3 Deep Think 41.0% Google lanza Gemini 3 Pro con capacidades de razonamiento y multimodales de última generación
2025-11-14 MiroThinker v1.0 (72B variant) 37.7% MiroThinker v1.0 introduce escalado interactivo para agentes de investigación de código abierto
2025-11-07 Kimi K2 Thinking 44.9% Moonshot AI lanza Kimi K2 Thinking, un modelo de razonamiento de código abierto con 1T parámetros
2025-09-29 DeepSeek-V3.2-Exp 56.53% DeepSeek lanza DeepSeek-V3.2-Exp con Atención Escasa para eficiencia en contextos largos
2025-09-16 Tongyi DeepResearch 32.9% Tongyi lanza DeepResearch, un agente web de código abierto que iguala el rendimiento propietario
2025-08-07 GPT-5 Pro 42.0% OpenAI lanza GPT-5 unificado con enrutamiento en tiempo real y acceso gratuito
2025-08-07 GPT-5 24.8% OpenAI
2025-07-09 Grok 4 Heavy 50.7% xAI lanza Grok 4 con aprendizaje por refuerzo escalado y uso nativo de herramientas
2025-07-09 Grok 4 25.4% xAI
2025-04-05 Gemini 2.5 Pro 18.8% Google amplía el acceso a Gemini 2.5 Pro ante sólidos resultados en benchmarks
2025-03-26 Gemini 2.5 Pro 18.8% Google lanza el modelo de razonamiento experimental Gemini 2.5 Pro con contexto de 1M tokens
2025-03-25 Gemini 2.5 Pro (experimental) 18.8% Google DeepMind lanza el modelo experimental Gemini 2.5 Pro
2025-03-25 Gemini 2.5 Pro 18.8% Google presenta el modelo de pensamiento Gemini 2.5 Pro
2025-03-25 Gemini 2.5 Pro 18.8% Google presenta el modelo experimental Gemini 2.5 Pro
2025-02-02 the model powering deep research 26.6% OpenAI lanza investigación profunda en ChatGPT como una capacidad agéntica
2025-01-23 DeepSeek R1 (text-only) 9.4% Humanity's Last Exam