Benchmark · reasoning

Humanity's Last Exam

32 résultats 24 modèles

Humanity's Last Exam (HLE) est un benchmark de questions expertes de pointe couvrant de nombreux domaines (mathématiques, sciences, sciences humaines et autres), conçu délibérément pour être extrêmement difficile pour l'IA. Il rapporte la performance en pourcentage de bonnes réponses (accuracy).

En savoir plus
Exemple
Chaque item est une question experte à réponse fermée n'ayant qu'une seule bonne réponse ; par exemple un problème avancé de mathématiques ou une question scientifique de niveau doctorat (certaines accompagnées d'une image), posée sous forme de choix multiple ou de réponse courte exacte.
Notation
La métrique est l'exactitude (accuracy) : le pourcentage de questions auxquelles le modèle répond correctement. Certaines versions rapportent aussi une mesure de calibration (confiance) en plus de l'exactitude.
Vérification
Chaque question a une réponse correcte connue, et la réponse du modèle est notée automatiquement par rapport à cette référence (la bonne option en choix multiple, une réponse courte correspondante) : une notation automatique et objective, non fondée sur un vote humain.
Pourquoi c'est important
Les benchmarks habituels sont saturés (les meilleurs modèles frôlent le plafond), aussi HLE vise à être un test difficile et discriminant à la frontière du savoir expert humain — un indicateur pertinent de la distance qui sépare l'IA d'un raisonnement de niveau expert.
Exemple résolu
Tâche
Les colibris (ordre des Apodiformes) possèdent de façon unique un os sésamoïde (sesamoid) ovale et bilatéralement pairé, enchâssé dans la partie caudolatérale de l'aponévrose (aponeurosis) cruciforme élargie d'insertion du m. depressor caudae. Combien de tendons pairés cet os sésamoïde soutient-il ? Répondez par un seul nombre entier.
Solution
4
Explication
L'os sésamoïde ovale se forme au sein de l'aponévrose cruciforme du muscle abaisseur de la queue et soutient quatre tendons pairés de cette insertion — une ossification spécialisée propre à l'anatomie caudale des colibris. HLE note la réponse par correspondance exacte du nombre entier soumis avec la réponse de référence (4) et sollicite séparément une confiance pour la calibration.
0 16 32 48 64 2025-01-23 2025-11-02 2026-08-13 the model powering deep research · 26.6 · 2025-02-02 Gemini 2.5 Pro (experimental) · 18.8 · 2025-03-25 Gemini 2.5 Pro · 18.8 · 2025-03-25 Gemini 2.5 Pro · 18.8 · 2025-03-25 Gemini 2.5 Pro · 18.8 · 2025-03-26 Gemini 2.5 Pro · 18.8 · 2025-04-05 Grok 4 Heavy · 50.7 · 2025-07-09 GPT-5 Pro · 42 · 2025-08-07 Tongyi DeepResearch · 32.9 · 2025-09-16 DeepSeek-V3.2-Exp · 56.5 · 2025-09-29 Kimi K2 Thinking · 44.9 · 2025-11-07 MiroThinker v1.0 (72B variant) · 37.7 · 2025-11-14 Gemini 3 Pro · 37.5 · 2025-11-18 Gemini 3 Pro · 37.5 · 2025-11-18 Gemini 3 Deep Think · 41 · 2025-11-18 Gemini 3 Deep Think · 41 · 2025-11-18 Gemini 3 Deep Think · 48.4 · 2026-02-12 Kimi K2.5 · 51.8 · 2026-01-29 Claude Opus 4.6 · 53 · 2026-02-05 Claude Opus 4.6 · 40 · 2026-02-05 Claude Opus 4.6 · 53 · 2026-03-06 Claude Opus 4.7 · 46.9 · 2026-04-25 GPT-5.5 · 41.4 · 2026-04-25 Claude Fable 5 · 53 · 2026-06-09 Claude Opus 4.8 · 46 · 2026-07-01 Agents-A1 · 47.6 · 2026-07-06 PoTRE · 49.9 · 2026-07-23 Inkling-Small · 31.6 · 2026-08-03 DeepSeek-V4-Pro · 60 · 2026-08-13 DeepSeek R1 (text-only) · 9.4 · 2025-01-23 Grok 4 · 25.4 · 2025-07-09 GPT-5 · 24.8 · 2025-08-07
the model powering deep research Gemini 2.5 Pro (experimental) Gemini 2.5 Pro Grok 4 Heavy GPT-5 Pro Tongyi DeepResearch DeepSeek-V3.2-Exp Kimi K2 Thinking MiroThinker v1.0 (72B variant) Gemini 3 Pro Gemini 3 Deep Think Kimi K2.5 Claude Opus 4.6 Claude Opus 4.7 GPT-5.5 Claude Fable 5 Claude Opus 4.8 Agents-A1 PoTRE Inkling-Small DeepSeek-V4-Pro DeepSeek R1 (text-only) Grok 4 GPT-5
Chronologie
Date Modèle Score Source
2026-08-13 DeepSeek-V4-Pro 60.0% La version GA de DeepSeek-V4-Pro améliore les capacités des agents et ajoute le support de l'API Responses
2026-08-03 Inkling-Small 31.6% Thinking Machines Lab publie Inkling-Small, un modèle MoE multimodal à poids ouverts de 276B
2026-07-23 PoTRE 49.92% PoTRE présente un cadre multi-agents hétérogène pour le raisonnement au moment du test
2026-07-06 Agents-A1 47.6pts Étendre l'horizon, pas les paramètres : atteindre des performances de modèles à mille milliards de paramètres avec un agent de 35M
2026-07-01 Claude Opus 4.8 46.0% Anthropic lance Claude Opus 4.8 avec raisonnement adaptatif et honnêteté améliorée
2026-06-09 Claude Fable 5 53.0% Claude Fable 5 se lance à la première place de l'Indice d'Intelligence d'Artificial Analysis
2026-04-25 Claude Opus 4.7 46.9% OpenAI lance GPT-5.5, un modèle entièrement réentraîné avec traitement omnimodal natif
2026-04-25 GPT-5.5 41.4% OpenAI lance GPT-5.5, un modèle entièrement réentraîné avec traitement omnimodal natif
2026-03-06 Claude Opus 4.6 53.0% Anthropic publie la fiche système de Claude Opus 4.6 détaillant les capacités et les évaluations de sécurité
2026-02-12 Gemini 3 Deep Think 48.4% Google lance Gemini 3 Deep Think amélioré avec de nouveaux scores de benchmark
2026-02-05 Claude Opus 4.6 53.0% Anthropic publie la fiche système de Claude Opus 4.6 détaillant les capacités et les évaluations de sécurité
2026-02-05 Claude Opus 4.6 40.0% Anthropic lance Claude Opus 4.6 avec une fenêtre de contexte de 1M et des améliorations agentic
2026-01-29 Kimi K2.5 51.8% Moonshot lance le modèle agentic multimodal Kimi K2.5
2025-11-18 Gemini 3 Pro 37.5% Google lance Gemini 3 Pro avec des capacités de raisonnement et multimodales de pointe
2025-11-18 Gemini 3 Deep Think 41.0% Google lance Gemini 3 Pro avec des capacités de raisonnement et multimodales de pointe
2025-11-18 Gemini 3 Pro 37.5% Google lance Gemini 3 Pro avec des capacités de raisonnement et multimodales de pointe
2025-11-18 Gemini 3 Deep Think 41.0% Google lance Gemini 3 Pro avec des capacités de raisonnement et multimodales de pointe
2025-11-14 MiroThinker v1.0 (72B variant) 37.7% MiroThinker v1.0 introduit le scaling interactif pour les agents de recherche open-source
2025-11-07 Kimi K2 Thinking 44.9% Moonshot AI publie Kimi K2 Thinking, un modèle de raisonnement open-source de 1T paramètres
2025-09-29 DeepSeek-V3.2-Exp 56.53% DeepSeek lance DeepSeek-V3.2-Exp avec une attention creuse pour l'efficacité du contexte long
2025-09-16 Tongyi DeepResearch 32.9% Tongyi lance DeepResearch, un agent web open-source aux performances égales aux solutions propriétaires
2025-08-07 GPT-5 Pro 42.0% OpenAI lance GPT-5 unifié avec routage en temps réel et accès gratuit
2025-08-07 GPT-5 24.8% OpenAI
2025-07-09 Grok 4 Heavy 50.7% xAI publie Grok 4 avec apprentissage par renforcement à grande échelle et utilisation native d'outils
2025-07-09 Grok 4 25.4% xAI
2025-04-05 Gemini 2.5 Pro 18.8% Google élargit l'accès à Gemini 2.5 Pro grâce à de solides résultats aux benchmarks
2025-03-26 Gemini 2.5 Pro 18.8% Google publie un modèle de raisonnement expérimental Gemini 2.5 Pro avec un contexte de 1M de tokens
2025-03-25 Gemini 2.5 Pro (experimental) 18.8% Google DeepMind lance le modèle expérimental Gemini 2.5 Pro
2025-03-25 Gemini 2.5 Pro 18.8% Google présente le modèle de raisonnement Gemini 2.5 Pro
2025-03-25 Gemini 2.5 Pro 18.8% Google présente le modèle expérimental Gemini 2.5 Pro
2025-02-02 the model powering deep research 26.6% OpenAI lance la recherche approfondie dans ChatGPT en tant que capacité agentic
2025-01-23 DeepSeek R1 (text-only) 9.4% Humanity's Last Exam