A GAIR-NLP apresenta o LIMO, um modelo que demonstra que o raciocínio matemático complexo pode ser efetivamente elicidado usando apenas 817 amostras de treinamento curadas. Esta abordagem desafia a suposição convencional de que o ajuste fino supervisionado requer conjuntos de dados massivos para evitar memorização.

  • O LIMO atinge 57,1% de precisão no benchmark AIME e 94,8% no MATH.
  • O modelo usa apenas 1% dos dados de treinamento exigidos por modelos SFT fortes anteriores.
  • Ele demonstra generalização fora da distribuição excepcional, melhorando o desempenho em 40,5 pontos percentuais absolutos através de 10 benchmarks diversos.
  • Os resultados superam modelos treinados com 100 vezes mais dados, apoiando a "Hipótese do Raciocínio Menos-Eh-Mais".

Os autores propõem que capacidades sofisticadas de raciocínio emergem quando modelos base aproveitam conhecimento pré-treinado rico por meio de templates cognitivos mínimos e precisamente orquestrados.