Лаборатория Simple Scaling представляет s1-32B, модель рассуждений, которая демонстрирует высокую производительность благодаря контролируемой дообучке на тщательно отобранном наборе данных из 1000 примеров и технике под названием budget forcing. Этот подход управляет вычислениями во время тестирования либо прерывая процесс мышления модели, либо добавляя "Wait" для его продления, что позволяет модели перепроверять свои ответы.
- Набор данных s1K содержит 1000 вопросов, сопоставленных с цепочками рассуждений, дистиллированными из экспериментальной модели Google Gemini Thinking, отобранными по сложности, разнообразию и качеству.
- Budget forcing обеспечивает точный контроль над вычислениями во время тестирования; подавление токена конца мышления и добавление "Wait" стимулирует дальнейшее исследование пути решения.
- s1-32B превосходит OpenAI o1-preview на вопросах по конкурсной математике до 27% на бенчмарках MATH и AIME24.
- Масштабирование вычислений во время тестирования позволяет модели экстраполировать свою производительность с 50% до 57% на AIME24.
Авторы демонстрируют, что простое контролируемое дообучение в сочетании с прямым управлением длительностью мышления является высокоэффективным и требующим малого количества образцов методом для достижения масштабирования во время тестирования и сильных способностей к рассуждению.