GAIR-NLP представляет LIMO, модель, демонстрирующую, что сложные математические рассуждения можно эффективно вызывать, используя всего 817 тщательно отобранных обучающих примеров. Этот подход бросает вызов общепринятому предположению, что контролируемое тонкое настраивание требует массивных наборов данных для предотвращения запоминания.
- LIMO достигает точности 57.1% на бенчмарке AIME и 94.8% на MATH.
- Модель использует лишь 1% обучающих данных, необходимых предыдущим сильным моделям на основе SFT.
- Она демонстрирует исключительную обобщающую способность за пределами распределения, улучшая результаты на 40.5 процентных пункта в среднем по 10 разнообразным бенчмаркам.
- Результаты превосходят модели, обученные на данных в 100 раз больше, что поддерживает «Гипотезу рассуждений "Меньше — значит больше"».
Авторы предполагают, что сложные способности к рассуждению возникают, когда базовые модели используют богатые предварительно обученные знания через минимальные, точно выстроенные когнитивные шаблоны.