يقدم مختبر البساطة في التوسع (Simple Scaling lab) نموذج s1-32B، وهو نموذج استدلال يحقق أداءً قوياً من خلال الضبط الدقيق الخاضع للإشراف على مجموعة بيانات مُنتقاة مكونة من 1,000 عينة وتقنية تُسمى فرض الميزانية. يتحكم هذا النهج في الحوسبة وقت الاختبار إما بإنهاء عملية تفكير النموذج أو بإلحاق "انتظر" لتمديدها، مما يسمح للنموذج بالتحقق مرة أخرى من إجاباته.

  • تحتوي مجموعة البيانات s1K على 1,000 سؤال مقترنة بآثار استدلال مُستخلصة من نموذج Google's Gemini Thinking Experimental، وتم اختيارها بناءً على الصعوبة والتنوع والجودة.
  • يسمح فرض الميزانية بالتحكم الدقيق في الحوسبة وقت الاختبار؛ فقمع رمز نهاية التفكير وإضافة "انتظر" يشجع على استكشاف مسار الحل بشكل أكبر.
  • يتفوق s1-32B على نموذج OpenAI’s o1-preview في أسئلة الرياضيات التنافسية بنسبة تصل إلى 27% على معيارَي MATH وAIME24.
  • يسمح توسيع الحوسبة وقت الاختبار للنموذج باستقراء أدائه من 50% إلى 57% على AIME24.

يُظهر المؤلفون أن الضبط الدقيق الخاضع للإشراف البسيط المقترن بالتحكم المباشر في مدة التفكير هو أسلوب فعال للغاية ووفير للعينات لتحقيق توسع وقت الاختبار وقدرات استدلال قوية.