A Epoch AI apresentou o FrontierMath, um benchmark composto por centenas de problemas originais de matemática elaborados por especialistas, projetado para avaliar capacidades de raciocínio avançado em sistemas de IA. Desenvolvido em colaboração com mais de 60 matemáticos, incluindo laureados com a Medalha Fields, os problemas abrangem áreas de pesquisa moderna como teoria dos números e geometria algébrica, exigindo tipicamente horas ou dias para que especialistas os resolvam.
- O benchmark apresenta problemas que são "à prova de chute" e verificáveis automaticamente por meio de computação.
- A avaliação de seis modelos líderes, incluindo Claude 3.5 Sonnet e GPT-4o, mostrou que nenhum conseguiu resolver mais de 2% dos problemas, apesar de frameworks extensos de suporte.
- Esse desempenho contrasta fortemente com benchmarks como GSM-8K, onde os melhores modelos alcançam mais de 90% de precisão.
- A Epoch AI planeja realizar avaliações regulares, expandir o benchmark e lançar problemas adicionais nos próximos meses.
O FrontierMath visa fornecer uma medida padronizada do progresso no raciocínio matemático de nível de pesquisa à medida que os sistemas de IA avançam, destacando uma lacuna substancial entre as capacidades atuais da IA e as dos matemáticos especialistas.