Simple Scaling 연구진은 s1-32B를 소개합니다. 이 추론 모델은 1,000개의 샘플로 구성된 선별된 데이터셋에 대한 지도 미세 조정과 '예산 강제화(budget forcing)'라는 기법을 통해 강력한 성능을 달성합니다. 이 접근 방식은 모델의 사고 과정을 종료하거나 "Wait"를 추가하여 이를 연장함으로써 테스트 타임 컴퓨팅을 제어하며, 모델을 통해 답변을 다시 검증할 수 있게 합니다.
- s1K 데이터셋에는 Google의 Gemini Thinking Experimental 모델에서 증류된 추론 트레이스와 짝을 이룬 1,000개의 질문이 포함되어 있으며, 이는 난이도, 다양성 및 품질을 기준으로 선택되었습니다.
- 예산 강제화는 테스트 타임 컴퓨팅에 정밀한 제어를 가능하게 합니다. 사고 종료 토큰을 억제하고 "Wait"를 추가하면 해결 경로에 대한 추가 탐색을 촉진합니다.
- s1-32B는 MATH 및 AIME24 벤치마크에서 최대 27%까지 OpenAI의 o1-preview를 경쟁 수학 질문에서 능가합니다.
- 테스트 타임 컴퓨팅을 스케일링하면 모델이 AIME24에서 성능을 50%에서 57%로 외삽할 수 있습니다.
저자들은 단순한 지도 미세 조정과 사고 기간에 대한 직접적인 제어를 결합하는 것이 테스트 타임 스케일링과 강력한 추론 능력을 달성하기 위해 매우 효과적이고 샘플 효율적인 방법임을 입증합니다.