DeepSeekは、人間の注釈付きデモンストレーションに依存せずに推論能力を向上させるために純粋な強化学習を使用して訓練された大規模言語モデルであるDeepSeek-R1をリリースしました。
このモデルは、自己反省、検証、動的戦略適応を含む、出現した高度な推論パターンを示します。数学、プログラミング競技、STEM分野の検証可能なタスクにおいて、従来の教師あり学習で訓練されたモデルと比較して優れたパフォーマンスを達成します。さらに、この大規模モデルによって開発された推論パターンは、より小さなモデルをガイドし改善するために使用できます。
このアプローチは、強化学習のみがLLM内で複雑な推論行動を効果的に促進でき、広範な人間のラベル付きデータへの依存を減らすことを示しています。