OpenAI menyediakan pendanaan untuk benchmark matematika independen FrontierMath sambil terikat oleh perjanjian kerahasiaan yang mencegah Epoch AI mengungkapkan hubungan ini hingga setelah OpenAI mengumumkan kinerja memecahkan rekor model o3-nya. Benchmark tersebut, yang dikembangkan oleh lebih dari 60 matematikawan, menguji kemampuan penalaran kompleks, dan o3 milik OpenAI mencapai tingkat keberhasilan sebesar 25,2 persen di dalamnya.

  • FrontierMath diperkenalkan pada November 2024 untuk mengevaluasi kemampuan pemecahan masalah matematika lanjutan.
  • Epoch AI menandatangani perjanjian yang mencegah pengungkapan dukungan keuangan OpenAI hingga pengumuman o3 pada 20 Desember.
  • Masalah benchmark dibuat oleh tim lebih dari 60 matematikawan terkemuka yang tidak mengetahui sumber pendanaan.
  • OpenAI mendapatkan akses ke "sebagian besar tetapi tidak semua" data FrontierMath, meskipun perjanjian lisan melarang penggunaan materi tersebut untuk pelatihan model.
  • Epoch AI mengakui kurangnya transparansi sebagai kesalahan dan berjanji memberikan informasi yang lebih jelas mengenai sumber pendanaan dalam kolaborasi di masa depan.

Situasi ini menyoroti kompleksitas benchmarking AI dan pentingnya transparansi, terutama karena penalaran matematika merupakan kelemahan utama bagi model bahasa.