Le laboratoire Simple Scaling présente s1-32B, un modèle de raisonnement qui atteint des performances solides grâce à un ajustement fin supervisé sur un ensemble de données curaté de 1 000 échantillons et une technique appelée « budget forcing ». Cette approche contrôle le calcul au moment du test en terminant soit le processus de réflexion du modèle, soit en ajoutant « Wait » pour l'étendre, permettant ainsi au modèle de vérifier ses réponses.

  • L'ensemble de données s1K contient 1 000 questions associées à des traces de raisonnement distillées à partir du modèle expérimental Gemini Thinking de Google, sélectionnées pour leur difficulté, leur diversité et leur qualité.
  • Le « budget forcing » permet un contrôle précis du calcul au moment du test ; supprimer le jeton de fin de réflexion et ajouter « Wait » encourage une exploration plus approfondie du chemin de la solution.
  • s1-32B dépasse o1-preview d'OpenAI sur les questions de mathématiques de compétition jusqu'à 27 % sur les benchmarks MATH et AIME24.
  • La mise à l'échelle du calcul au moment du test permet au modèle d'extrapoler ses performances, passant de 50 % à 57 % sur AIME24.

Les auteurs démontrent que l'ajustement fin supervisé simple combiné à un contrôle direct de la durée de réflexion est une méthode très efficace et économe en échantillons pour atteindre la mise à l'échelle au moment du test et des capacités de raisonnement solides.