GAIR-NLP 推出了 LIMO,该模型证明了仅使用 817 个精心策划的训练样本即可有效激发复杂的数学推理能力。这种方法挑战了监督微调需要海量数据集以避免过拟合的传统假设。
- LIMO 在 AIME 基准测试中达到 57.1% 的准确率,在 MATH 上达到 94.8%。
- 该模型仅使用之前强大的基于 SFT 模型所需训练数据的 1%。
- 它展示了卓越的分布外泛化能力,在 10 个多样化基准测试中绝对性能提升了 40.5%。
- 结果优于使用多 100 倍数据训练的模型,支持“少即是多推理假设”。
作者提出,当基础模型通过最小且精确编排的认知模板利用丰富的预训练知识时,复杂的推理能力就会涌现。