GAIR-NLP présente LIMO, un modèle démontrant qu'un raisonnement mathématique complexe peut être efficacement sollicité en utilisant seulement 817 échantillons d'entraînement curés. Cette approche défie l'hypothèse conventionnelle selon laquelle le réglage fin supervisé nécessite des ensembles de données massifs pour éviter la mémorisation.
- LIMO atteint 57,1 % de précision sur le benchmark AIME et 94,8 % sur MATH.
- Le modèle utilise seulement 1 % des données d'entraînement requises par les modèles SFT puissants précédents.
- Il démontre une généralisation hors distribution exceptionnelle, améliorant les performances de 40,5 points absolus à travers 10 benchmarks divers.
- Les résultats surpassent les modèles entraînés sur 100 fois plus de données, soutenant l'« Hypothèse du Raisonnement Moins-Est-Plus ».
Les auteurs proposent que des capacités de raisonnement sophistiquées émergent lorsque les modèles de base exploitent des connaissances pré-entraînées riches via des templates cognitifs minimaux et précisément orchestrés.