Simple Scaling实验室推出了s1-32B,这是一种推理模型,通过在包含1,000个样本的精选数据集上进行监督微调以及一种称为“预算强制”的技术,实现了强大的性能。该方法通过终止模型的思考过程或附加“Wait”来延长思考时间,从而控制测试时的计算量,使模型能够双重检查其答案。

  • s1K数据集包含1,000个问题及其推理轨迹,这些轨迹是从Google的Gemini Thinking Experimental模型中蒸馏而来,并根据难度、多样性和质量进行选择。
  • 预算强制允许对测试时的计算进行精确控制;抑制思考结束令牌并添加“Wait”鼓励进一步探索解决方案路径。
  • s1-32B在MATH和AIME24基准测试上的竞赛数学问题上比OpenAI的o1-preview高出多达27%。
  • 扩展测试时计算使模型在AIME24上的性能从50%外推到57%。

作者证明,简单的监督微调结合对思考时间的直接控制是实现测试时扩展和强大推理能力的高效且样本高效的方法。