Lab Simple Scaling memperkenalkan s1-32B, sebuah model penalaran yang mencapai kinerja kuat melalui fine-tuning terawasi pada dataset kurasi berisi 1.000 sampel dan teknik yang disebut pemaksaan anggaran (budget forcing). Pendekatan ini mengendalikan komputasi saat pengujian dengan cara menghentikan proses berpikir model atau menambahkan "Wait" untuk memperpanjangnya, memungkinkan model memeriksa ulang jawabannya.

  • Dataset s1K berisi 1.000 pertanyaan yang dipasangkan dengan jejak penalaran yang disuling dari model Google Gemini Thinking Experimental, dipilih berdasarkan kesulitan, keragaman, dan kualitas.
  • Pemaksaan anggaran memungkinkan kontrol presisi atas komputasi saat pengujian; menekan token akhir-pemikiran dan menambahkan "Wait" mendorong eksplorasi lebih lanjut jalur solusi.
  • s1-32B melampaui OpenAI’s o1-preview pada soal matematika kompetisi hingga 27% pada benchmark MATH dan AIME24.
  • Penskalaan komputasi saat pengujian memungkinkan model mengekstrapolasikan kinerjanya dari 50% menjadi 57% pada AIME24.

Para penulis menunjukkan bahwa fine-tuning terawasi sederhana yang dikombinasikan dengan kontrol langsung atas durasi berpikir adalah metode yang sangat efektif dan efisien sampel untuk mencapai penskalaan saat pengujian serta kemampuan penalaran yang kuat.