El laboratorio Simple Scaling presenta s1-32B, un modelo de razonamiento que logra un rendimiento sólido mediante ajuste fino supervisado en un conjunto de datos curado de 1.000 muestras y una técnica llamada forzamiento de presupuesto (budget forcing). Este enfoque controla el cómputo en tiempo de prueba ya sea terminando el proceso de pensamiento del modelo o añadiendo "Wait" para extenderlo, permitiendo que el modelo verifique sus respuestas.

  • El conjunto de datos s1K contiene 1.000 preguntas emparejadas con trazos de razonamiento destilados del modelo experimental Gemini Thinking de Google, seleccionados por dificultad, diversidad y calidad.
  • El forzamiento de presupuesto permite un control preciso sobre el cómputo en tiempo de prueba; suprimir el token de fin de pensamiento y añadir "Wait" fomenta una mayor exploración de la ruta de solución.
  • s1-32B supera a o1-preview de OpenAI en preguntas de matemáticas competitivas hasta un 27% en los benchmarks MATH y AIME24.
  • Escalar el cómputo en tiempo de prueba permite al modelo extrapolar su rendimiento del 50% al 57% en AIME24.

Los autores demuestran que el ajuste fino supervisado simple combinado con un control directo sobre la duración del pensamiento es un método altamente efectivo y eficiente en muestras para lograr escalado en tiempo de prueba y sólidas capacidades de razonamiento.