GAIR-NLP은 LIMO를 소개했으며, 이는 복잡한 수학적 추론이 선별된 학습 샘플 817개만으로 효과적으로 유도될 수 있음을 보여줍니다. 이 접근 방식은 암기를 피하기 위해 감독 세밀 조정(SFT)에 막대한 데이터셋이 필요하다는 기존의 가정에 도전합니다.
- LIMO는 AIME 벤치마크에서 57.1%의 정확도와 MATH에서 94.8%의 정확도를 달성했습니다.
- 이 모델은 이전 강력한 SFT 기반 모델이 요구하는 학습 데이터의 단 1%만 사용합니다.
- 분포 밖 일반화에서 탁월한 성능을 보여주며, 10가지 다양한 벤치마크 전반에 걸쳐 절대적으로 40.5% 성능 개선을 보였습니다.
- 결과는 100배 더 많은 데이터로 훈련된 모델을 능가하며, "Less-Is-More Reasoning Hypothesis(적은 것이 많다는 추론 가설)"를 지지합니다.
저자들은 기초 모델이 최소한의 정교하게 구성된 인지 템플릿을 통해 풍부한 사전 학습 지식을 활용할 때 정교한 추론 능력이 나타난다고 제안합니다.