GAIR-NLP presenta LIMO, un modelo que demuestra que el razonamiento matemático complejo puede ser efectivamente elicidado utilizando solo 817 muestras de entrenamiento curadas. Este enfoque desafía la suposición convencional de que el ajuste fino supervisado requiere conjuntos de datos masivos para evitar la memorización.

  • LIMO alcanza una precisión del 57.1% en el benchmark AIME y del 94.8% en MATH.
  • El modelo utiliza solo el 1% de los datos de entrenamiento requeridos por modelos SFT anteriores fuertes.
  • Demuestra una generalización fuera de distribución excepcional, mejorando el rendimiento en un 40.5% absoluto a través de 10 benchmarks diversos.
  • Los resultados superan a modelos entrenados con 100 veces más datos, apoyando la "Hipótesis del Razonamiento Menos-Es-Más".

Los autores proponen que las capacidades sofisticadas de razonamiento emergen cuando los modelos base aprovechan el conocimiento preentrenado rico mediante plantillas cognitivas mínimas y precisamente orquestadas.