Epoch AI는 AI 시스템의 고급 추론 능력을 평가하기 위해 설계된 수백 개의 독창적이고 전문가가 작성한 수학 문제로 구성된 FrontierMath라는 벤치마크를 소개했습니다. 필즈상 수상자를 포함한 60명 이상의 수학자와 협력하여 개발된 이 문제들은 정수론과 대수기하학 같은 현대 연구 분야를 아우르며, 일반적으로 전문가에게 해결에 몇 시간에서 며칠이 걸립니다.

  • 이 벤치마크는 "추측 방지" 기능과 계산을 통한 자동 검증을 특징으로 합니다.
  • Claude 3.5 Sonnet과 GPT-4o를 포함한 여섯 개의 주요 모델을 평가한 결과, 광범위한 지원 프레임워크에도 불구하고 어떤 모델도 문제의 2% 이상을 해결하지 못했습니다.
  • 이 성능은 상위 모델이 90% 이상의 정확도를 달성하는 GSM-8K와 같은 벤치마크와 뚜렷한 대조를 이룹니다.
  • Epoch AI는 향후 몇 달 동안 정기적인 평가를 진행하고 벤치마크를 확장하며 추가 문제를 출시할 계획입니다.

FrontierMath는 AI 시스템이 발전함에 따라 연구 수준의 수학 추론에서 진전을 측정하기 위한 표준화된 척도를 제공하여, 현재 AI 능력과 전문가 수학자 간의 상당한 격차를 부각시키는 것을 목표로 합니다.