DeepSeekは、そのDeepSeek-R1-0528モデルに重要なアップデートを提供し、推論能力を強化するとともに、OpenAIおよびGoogleの主要なプロプライエタリモデルとのパフォーマンスギャップを縮小した。このアップデートでは、コアアーキテクチャを変更せずに、数学、コーディング、論理のベンチマーク全体で精度を向上させるために、改善されたアルゴリズムと増強されたコンピューティングパワーを活用している。

  • AIME 2025において、正答率は70%から87.5%に上昇し、平均プロンプトトークンは12,000から23,000に増加した。
  • 数学ベンチマークでは、AIME 2024(79.8%から91.4%)、HMMT 2025(41.7%から79.4%)、CNMO 2024(78.8%から86.9%)で向上が見られた。
  • コーディングパフォーマンスはLiveCodeBench(63.5%から73.3%)とAider-Polyglot(53.3%から71.6%)で改善し、Codeforcesのレーティングも1530から1930に上昇した。
  • 一般知識スコアはGPQA-Diamond(71.5%から81.0%)とHumanity's Last Exam(8.5%から17.7%)で増加した。
  • 独立系のプラットフォームArtificial Analysisはこのモデルを68と評価し、MetaのLlama 4 MaverickやAlibabaのQwen3 253を上回る順位につけた。

このアップデートは、オープンウェイトモデルが強化学習によるポストトレーニングの強化を通じて競争力のあるパフォーマンスを達成できることを示している。DeepSeekはまた、Nvidia H100上で効率的に動作しながらAIME 2024で86%を達成する蒸留版DeepSeek-R1-0528-Qwen3-8Bもリリースした。