OpenAI telah mengumumkan o3, model penalaran generasi berikutnya yang menetapkan rekor baru dalam penalaran, pemrograman, dan penyelesaian masalah matematika. Model ini mencapai skor 75,7% pada evaluasi semi-privat ARC-AGI eval dalam mode komputasi rendah dan 87,5% dalam mode komputasi tinggi.

  • o3 mencetak skor 75,7% pada ARC-AGI (komputasi rendah) dan 87,5% (komputasi tinggi), melampaui ambang batas tingkat manusia sebesar 85%.
  • Model ini mencapai skor 96,7% pada Olimpiade Matematika Amerika 2024 (AIME) dan 25,2% pada Frontier Math Benchmark milik EpochAI.
  • Dalam pemrograman, o3 mencetak skor 71,7 pada SWE-Bench Verified (22,8 poin lebih tinggi dari o1) dan peringkat Elo 2.727 di Codeforces.
  • Model ini memiliki jendela konteks sebesar 128K token dan dikenal karena biaya operasinya yang jauh lebih mahal dibandingkan iterasi sebelumnya.