Benchmark · math

FrontierMath

20 résultats 15 modèles

FrontierMath est un benchmark d'Epoch AI qui mesure la capacité d'un modèle d'IA à résoudre des problèmes mathématiques extrêmement difficiles et inédits, de niveau recherche. Le score correspond au pourcentage de problèmes résolus correctement, et les modèles actuels n'en résolvent qu'une petite fraction, loin de la saturation.

En savoir plus
Exemple
Un unique problème inédit issu d'un domaine avancé comme la théorie des nombres, la géométrie algébrique ou la combinatoire, dont la résolution exige une expertise poussée et aboutit à une seule réponse finale précise (par exemple un entier déterminé ou un objet mathématique exact).
Notation
La métrique est l'exactitude (accuracy) : la proportion de problèmes dont la réponse finale correspond exactement à la réponse de référence, exprimée en pourcentage.
Vérification
Chaque problème possède une réponse unique, définie et vérifiable automatiquement, si bien qu'une solution n'est acceptée que si elle correspond exactement à la référence ; les problèmes sont conçus par des mathématiciens experts pour qu'on ne puisse presque jamais tomber juste par hasard.
Pourquoi c'est important
Comme les problèmes sont inédits, il résiste à la mémorisation, et il reste loin d'être résolu : c'est l'un des rares benchmarks de mathématiques qui distingue encore nettement un véritable raisonnement mathématique avancé d'une simple reconnaissance de motifs.
Exemple résolu
Tâche
Déterminez le nombre d'entiers $n$ avec $0 \le n < 3^{13}$ pour lesquels le coefficient binomial central $\binom{2n}{n}$ n'est pas divisible par $3$.
Solution
D'après le théorème de Kummer, $3 \nmid \binom{2n}{n}$ précisément lorsque l'addition $n+n$ en base 3 ne produit aucune retenue, c'est-à-dire que chaque chiffre de $n$ en base 3 vaut 0 ou 1. Sur $0 \le n < 3^{13}$, cela donne 2 choix pour chacun des 13 chiffres, donc le compte est $2^{13} = 8192$.
Explication
Le théorème de Kummer donne $v_3\binom{2n}{n}$ comme le nombre de retenues lors de l'addition de $n$ avec lui-même en base 3 ; zéro retenue impose que chaque chiffre en base 3 soit 0 ou 1, soit 2 choix par chiffre sur 13 chiffres. Notation : un vérificateur automatique compare exactement l'unique entier final (8192).
0 14 28 42 56 2024-11-08 2025-08-01 2026-04-25 Claude 3.5 Sonnet · 2 · 2024-11-08 Gemini 1.5 Pro · 2 · 2024-11-08 GPT-4o · 2 · 2024-11-08 o1-preview · 2 · 2024-11-08 o3 · 25 · 2024-12-20 o3 · 25 · 2024-12-22 o3 · 25.2 · 2025-01-19 o3 · 25 · 2025-01-29 o3 · 10 · 2025-04-20 o3-mini with high reasoning and a Python tool · 32 · 2025-03-17 Gemini 2.5 Deep Think · 29 · 2025-10-09 GPT-5 Pro · 13 · 2025-10-13 Claude 4.5 Opus · 21 · 2025-12-04 Gemini 3 Pro · 38 · 2025-12-04 GPT-5.2 Thinking · 40.3 · 2025-12-11 GPT-5.2 Pro · 31 · 2026-01-23 GPT-5.5 Pro · 39.6 · 2026-04-23 GPT-5.5 · 35.4 · 2026-04-23 GPT-5.5 · 51.7 · 2026-04-25 OpenAI o3 · 25.2 · 2024-12-20
Claude 3.5 Sonnet Gemini 1.5 Pro GPT-4o o1-preview o3 o3-mini with high reasoning and a Python tool Gemini 2.5 Deep Think GPT-5 Pro Claude 4.5 Opus Gemini 3 Pro GPT-5.2 Thinking GPT-5.2 Pro GPT-5.5 Pro GPT-5.5 OpenAI o3
Chronologie
Date Modèle Score Source
2026-04-25 GPT-5.5 51.7% OpenAI lance GPT-5.5, un modèle entièrement réentraîné avec traitement omnimodal natif
2026-04-23 GPT-5.5 Pro 39.6% OpenAI lance GPT-5.5 avec des capacités agentic et un doublement du prix de l'API
2026-04-23 GPT-5.5 35.4% OpenAI lance GPT-5.5 avec des capacités agentic et un doublement du prix de l'API
2026-01-23 GPT-5.2 Pro 31.0% GPT-5.2 Pro obtient 31 % sur FrontierMath Tier 4
2025-12-11 GPT-5.2 Thinking 40.3% OpenAI lance les modèles GPT-5.2 Pro et Thinking pour la science et les mathématiques
2025-12-04 Claude 4.5 Opus 21.0% Epoch AI lance le Hub des Data Centers Frontier et analyse le benchmark OSWorld
2025-12-04 Gemini 3 Pro 38.0% Epoch AI lance le Hub des Data Centers Frontier et analyse le benchmark OSWorld
2025-10-13 GPT-5 Pro 13.0% GPT-5 Pro résout un problème du niveau 4 de FrontierMath, devançant légèrement Gemini 2.5 Deep Think
2025-10-09 Gemini 2.5 Deep Think 29.0% Epoch AI évalue les capacités mathématiques de Gemini 2.5 Deep Think
2025-04-20 o3 10.0% Les résultats d'o3 d'OpenAI sur FrontierMath sont inférieurs aux affirmations initiales
2025-03-17 o3-mini with high reasoning and a Python tool 32.0% L'évaluation par Epoch de o3-mini sur FrontierMath donne 11% contre 32% pour OpenAI
2025-01-29 o3 25.0% Le modèle o3 d'OpenAI atteint 25 % au benchmark Frontier Math
2025-01-19 o3 25.2% OpenAI a financé le benchmark FrontierMath avant qu'o3 ne batte un record
2024-12-22 o3 25.0% Le modèle o3 d'OpenAI obtient 25 % au benchmark FrontierMath de mathématiques difficiles
2024-12-20 o3 25.0% OpenAI présente en avant-première le modèle de raisonnement o3 avec des percées sur ARC AGI et Frontier Math
2024-12-20 OpenAI o3 25.2% Epoch AI
2024-11-08 Claude 3.5 Sonnet 2.0% Epoch AI publie le benchmark FrontierMath pour évaluer le raisonnement mathématique avancé
2024-11-08 Gemini 1.5 Pro 2.0% Epoch AI publie le benchmark FrontierMath pour évaluer le raisonnement mathématique avancé
2024-11-08 GPT-4o 2.0% Epoch AI publie le benchmark FrontierMath pour évaluer le raisonnement mathématique avancé
2024-11-08 o1-preview 2.0% Epoch AI publie le benchmark FrontierMath pour évaluer le raisonnement mathématique avancé