O laboratório Simple Scaling apresenta o s1-32B, um modelo de raciocínio que alcança desempenho robusto por meio de ajuste fino supervisionado em um conjunto de dados curado de 1.000 amostras e uma técnica chamada forçamento de orçamento. Essa abordagem controla o poder computacional no momento do teste terminando o processo de pensamento do modelo ou adicionando "Wait" para estendê-lo, permitindo que o modelo verifique suas respostas.

  • O conjunto de dados s1K contém 1.000 perguntas pareadas com rastros de raciocínio destilados do modelo experimental Gemini Thinking do Google, selecionados por dificuldade, diversidade e qualidade.
  • O forçamento de orçamento permite controle preciso sobre o poder computacional no momento do teste; suprimir o token de fim de pensamento e adicionar "Wait" incentiva a exploração adicional do caminho da solução.
  • O s1-32B supera o o1-preview da OpenAI em questões de matemática competitiva em até 27% nos benchmarks MATH e AIME24.
  • Escalonar o poder computacional no momento do teste permite que o modelo extrapole seu desempenho de 50% para 57% no AIME24.

Os autores demonstram que o ajuste fino supervisionado simples, combinado com controle direto sobre a duração do pensamento, é um método altamente eficaz e eficiente em amostras para alcançar escalonamento no momento do teste e fortes capacidades de raciocínio.