Epoch AIは、AIシステムの高度な推論能力を評価するために設計された、数百のオリジナルで専門家が作成した数学的問題からなるベンチマーク「FrontierMath」を発表しました。フィールズ賞受賞者を含む60人以上の数学者と共同開発されたこの問題は、数論や代数幾何学などの現代の研究領域にまたがり、専門家にとって解決に数時間から数日を要するものとなっています。

  • このベンチマークには、「推測不可能」で計算を通じて自動的に検証可能な問題が含まれています。
  • Claude 3.5 SonnetやGPT-4oを含む6つの主要モデルの評価では、広範な支援フレームワークがあっても、どのモデルも問題の2%以上を解決できませんでした。
  • このパフォーマンスは、トップモデルが90%以上の精度を達成するGSM-8Kなどのベンチマークとは対照的です。
  • Epoch AIは今後数ヶ月以内に定期的な評価の実施、ベンチマークの拡大、および追加の問題の公開を計画しています。

FrontierMathは、AIシステムが進化する中で研究レベルの数学的推論における進歩の標準的な指標を提供し、現在のAIの能力と専門家の数学者との間の大きなギャップを浮き彫りにすることを目指しています。