DeepSeekは、推論能力を向上させるために強化学習でファインチューニングされた大規模言語モデルDeepSeek-R1をオープンソース化しました。このモデルは、MATH-500やSWE-benchなどのベンチマークでOpenAIのo1と同等の結果を達成しています。

  • 専門家の混合であるDeepSeek-V3に基づいており、トレーニングにはGroup Relative Policy Optimization (GRPO)を使用しています。
  • チームは、強化学習の前に思考チェーンの例を用いた教師ありファインチューニングを追加することで、RLの「コールドスタート」の問題に対処しました。
  • QwenおよびLlama用の蒸留バージョンがリリースされ、数学やコーディングのタスクにおいてGPT-4などのより大きなモデルを上回りました。
  • リリース直後、DeepSeek-R1はLMArenaで総合3位となり、コーディングと数学のカテゴリで首位となりました。

オープンソースライセンスは、モデルの出力を蒸留に使用することを許可しており、あらゆる規模の言語モデルの最先端技術の進展が期待されます。