OpenAI merilis model o1-preview dan o1-mini, yang dilatih untuk meniru penalaran dengan menghasilkan dan menyempurnakan token penalaran sebelum memberikan jawaban akhir. Pengujian pada dataset evaluasi publik ARC-AGI menunjukkan bahwa kedua varian o1 melampaui GPT-4o dalam akurasi.

  • o1-preview mencapai akurasi yang sebanding dengan Claude 3.5 Sonnet dari Anthropic tetapi membutuhkan waktu sekitar 10 kali lebih lama untuk menyelesaikan tugas.
  • Menyelesaikan 400 tugas publik ARC-AGI memakan waktu 70 jam untuk o1, dibandingkan hanya 30 menit untuk GPT-4o dan Claude 3.5 Sonnet.
  • Model-model ini memanfaatkan paradigma chain-of-thought yang diterapkan pada saat pelatihan dan inferensi, dengan memanfaatkan pembelajaran penguatan untuk menyempurnakan strategi.
  • Kinerja meningkat seiring dengan komputasi saat pengujian, menunjukkan hubungan log-linear antara akurasi dan jumlah token penalaran yang digunakan.

Hasil-hasil ini menyoroti bahwa meskipun peningkatan komputasi saat pengujian meningkatkan akurasi, efisiensi tetap menjadi faktor kritis untuk aplikasi praktis dan benchmarking.