सिंपल स्केलिंग लैब ने s1-32B पेश किया, जो एक तर्कशील मॉडल है जो 1,000 नमूनों की एक चयनित डेटासेट पर सपर्वाइज्ड फाइन-ट्यूनिंग और 'बजट फोर्सिंग' नामक तकनीक के माध्यम से मजबूत प्रदर्शन हासिल करता है। यह दृष्टिकोण या तो मॉडल की सोचने की प्रक्रिया को समाप्त करके या इसे बढ़ाने के लिए "Wait" जोड़कर टेस्ट-टाइम कंप्यूट को नियंत्रित करता है, जिससे मॉडल अपने उत्तरों की दोबारा जांच कर सकता है।
- s1K डेटासेट में Google के Gemini Thinking Experimental मॉडल से निचोड़े गए तर्क ट्रेस के साथ 1,000 प्रश्न शामिल हैं, जिन्हें कठिनाई, विविधता और गुणवत्ता के आधार पर चुना गया है।
- बजट फोर्सिंग टेस्ट-टाइम कंप्यूट पर सटीक नियंत्रण की अनुमति देती है; थॉकिंग टोकन के अंत को दबाकर और "Wait" जोड़कर समाधान पथ का आगे अन्वेषण प्रोत्साहित किया जाता है।
- s1-32B MATH और AIME24 बेंचमार्क पर प्रतिस्पर्धा गणितीय प्रश्नों में OpenAI के o1-preview से 27% तक बेहतर प्रदर्शन करता है।
- टेस्ट-टाइम कंप्यूट को स्केल करने से मॉडल AIME24 पर अपने प्रदर्शन को 50% से 57% तक बढ़ा सकता है।
लेखकों ने दिखाया है कि सरल सपर्वाइज्ड फाइन-ट्यूनिंग के साथ सोचने की अवधि पर सीधा नियंत्रण मिलाना टेस्ट-टाइम स्केलिंग और मजबूत तर्कशील क्षमताओं को हासिल करने के लिए एक अत्यधिक प्रभावी और नमूना-कुशल विधि है।