GAIR-NLPはLIMOを発表しました。これは、複雑な数学的推論を厳選されたトレーニングサンプル817件だけで効果的に引き出せることを示すモデルです。このアプローチは、暗記を防ぐために教師ありファインチューニングには大量のデータセットが必要だという従来の仮定に挑戦します。
- LIMOはAIMEベンチマークで57.1%、MATHで94.8%の精度を達成しました。
- このモデルは、以前の強力なSFTベースのモデルが要求するトレーニングデータのわずか1%のみを使用します。
- 分布外一般化において卓越した性能を示し、10の多様なベンチマーク全体で絶対的に40.5%のパフォーマンス向上を実現しました。
- 結果は100倍のデータで訓練されたモデルを上回り、「Less-Is-More Reasoning Hypothesis(少ないことは多いことなり推論仮説)」を支えています。
著者らは、基礎モデルが最小限かつ精密に調整された認知テンプレートを通じて豊富な事前学習知識を活用するとき、洗練された推論能力が現れると提案しています。