Epoch AI a présenté FrontierMath, un benchmark composé de centaines de problèmes mathématiques originaux conçus par des experts, destinés à évaluer les capacités de raisonnement avancé des systèmes d'IA. Développé en collaboration avec plus de 60 mathématiciens, dont des lauréats de la médaille Fields, les problèmes couvrent des domaines de recherche modernes tels que la théorie des nombres et la géométrie algébrique, nécessitant généralement des heures ou des jours pour être résolus par des experts.
- Le benchmark propose des problèmes « résistants aux devinettes » et vérifiables automatiquement par le calcul.
- L'évaluation de six modèles de pointe, dont Claude 3.5 Sonnet et GPT-4o, a montré qu'aucun ne pouvait résoudre plus de 2 % des problèmes malgré des cadres de support étendus.
- Ces performances contrastent fortement avec des benchmarks comme GSM-8K, où les meilleurs modèles atteignent plus de 90 % de précision.
- Epoch AI prévoit de réaliser des évaluations régulières, d'étendre le benchmark et de publier de nouveaux problèmes dans les mois à venir.
FrontierMath vise à fournir une mesure standardisée des progrès en matière de raisonnement mathématique de niveau recherche à mesure que les systèmes d'IA évoluent, mettant en évidence un écart substantiel entre les capacités actuelles de l'IA et celles des mathématiciens experts.