A GAIR-NLP apresenta o LIMO, um modelo que demonstra que o raciocínio matemático complexo pode ser efetivamente elicidado usando apenas 817 amostras de treinamento curadas. Esta abordagem desafia a suposição convencional de que o ajuste fino supervisionado requer conjuntos de dados massivos para evitar memorização.
- O LIMO atinge 57,1% de precisão no benchmark AIME e 94,8% no MATH.
- O modelo usa apenas 1% dos dados de treinamento exigidos por modelos SFT fortes anteriores.
- Ele demonstra generalização fora da distribuição excepcional, melhorando o desempenho em 40,5 pontos percentuais absolutos através de 10 benchmarks diversos.
- Os resultados superam modelos treinados com 100 vezes mais dados, apoiando a "Hipótese do Raciocínio Menos-Eh-Mais".
Os autores propõem que capacidades sofisticadas de raciocínio emergem quando modelos base aproveitam conhecimento pré-treinado rico por meio de templates cognitivos mínimos e precisamente orquestrados.