Epoch AI ha presentado FrontierMath, un benchmark compuesto por cientos de problemas originales de matemáticas elaborados por expertos, diseñados para evaluar las capacidades de razonamiento avanzado en sistemas de IA. Desarrollado en colaboración con más de 60 matemáticos, incluidos medallistas Fields, los problemas abarcan áreas de investigación moderna como la teoría de números y la geometría algebraica, que normalmente requieren horas o días para ser resueltos por expertos.
- El benchmark incluye problemas que son "a prueba de adivinanzas" y verificables automáticamente mediante computación.
- La evaluación de seis modelos líderes, incluidos Claude 3.5 Sonnet y GPT-4o, mostró que ninguno pudo resolver más del 2% de los problemas a pesar de contar con marcos de apoyo extensos.
- Este rendimiento contrasta fuertemente con benchmarks como GSM-8K, donde los mejores modelos logran una precisión superior al 90%.
- Epoch AI planea realizar evaluaciones periódicas, expandir el benchmark y publicar problemas adicionales en los próximos meses.
FrontierMath tiene como objetivo proporcionar una medida estandarizada del progreso en el razonamiento matemático a nivel de investigación a medida que avanzan los sistemas de IA, destacando una brecha sustancial entre las capacidades actuales de la IA y las de los matemáticos expertos.