OpenAI merilis model o1-preview dan o1-mini, yang dilatih untuk meniru penalaran dengan menghasilkan dan menyempurnakan token penalaran sebelum memberikan jawaban akhir. Pengujian pada dataset evaluasi publik ARC-AGI menunjukkan bahwa kedua varian o1 melampaui GPT-4o dalam akurasi.
- o1-preview mencapai akurasi yang sebanding dengan Claude 3.5 Sonnet dari Anthropic tetapi membutuhkan waktu sekitar 10 kali lebih lama untuk menyelesaikan tugas.
- Menyelesaikan 400 tugas publik ARC-AGI memakan waktu 70 jam untuk o1, dibandingkan hanya 30 menit untuk GPT-4o dan Claude 3.5 Sonnet.
- Model-model ini memanfaatkan paradigma chain-of-thought yang diterapkan pada saat pelatihan dan inferensi, dengan memanfaatkan pembelajaran penguatan untuk menyempurnakan strategi.
- Kinerja meningkat seiring dengan komputasi saat pengujian, menunjukkan hubungan log-linear antara akurasi dan jumlah token penalaran yang digunakan.
Hasil-hasil ini menyoroti bahwa meskipun peningkatan komputasi saat pengujian meningkatkan akurasi, efisiensi tetap menjadi faktor kritis untuk aplikasi praktis dan benchmarking.