OpenAI mengklaim bahwa model o3-mini-nya dengan kemampuan penalaran tinggi dan akses alat Python mencapai skor 32% pada benchmark FrontierMath. Namun, evaluasi independen resmi Epoch melaporkan skor yang jauh lebih rendah, yaitu hanya 11%.

  • Epoch membangun benchmark ini dan memiliki insentif yang lebih baik untuk penskoran yang akurat.
  • OpenAI melaporkan skor 28% pada tingkat masalah tersulit, yang secara mencurigakan dekat dengan skor keseluruhannya.
  • Epoch telah menerbitkan informasi ekstensif tentang infrastruktur pengujian dan datanya, sedangkan OpenAI hanya menerbitkan sedikit.
  • Ketidaksesuaian mungkin berasal dari OpenAI menggunakan scaffold internal yang lebih kuat, komputasi saat pengujian yang lebih banyak, atau subset masalah yang berbeda (180 vs 290).

Perbedaan hasil ini menyoroti pentingnya metodologi evaluasi yang transparan dan verifikasi independen dalam benchmarking model bahasa besar.