DeepSeek a publié une mise à jour majeure de son modèle DeepSeek-R1-0528, améliorant ses capacités de raisonnement et comblant l'écart de performance avec les modèles propriétaires leaders d'OpenAI et Google. La mise à jour utilise des algorithmes améliorés et une puissance de calcul accrue pour augmenter la précision sur les benchmarks de mathématiques, de codage et de logique sans modifier l'architecture de base.

  • Sur AIME 2025, la précision est passée de 70 % à 87,5 %, tandis que le nombre moyen de tokens par prompt est passé de 12 000 à 23 000.
  • Les benchmarks de mathématiques ont enregistré des progrès sur AIME 2024 (de 79,8 % à 91,4 %), HMMT 2025 (de 41,7 % à 79,4 %) et CNMO 2024 (de 78,8 % à 86,9 %).
  • Les performances de codage se sont améliorées sur LiveCodeBench (de 63,5 % à 73,3 %) et Aider-Polyglot (de 53,3 % à 71,6 %), avec une augmentation du classement Codeforces de 1530 à 1930.
  • Les scores de connaissances générales ont augmenté sur GPQA-Diamond (de 71,5 % à 81,0 %) et Humanity's Last Exam (de 8,5 % à 17,7 %).
  • La plateforme indépendante Artificial Analysis a noté le modèle à 68, le classant devant Llama 4 Maverick de Meta et Qwen3 253 d'Alibaba.

La mise à jour démontre que les modèles à poids ouverts peuvent atteindre des performances compétitives grâce à un entraînement post-entraînement accru avec apprentissage par renforcement. DeepSeek a également publié une version distillée, DeepSeek-R1-0528-Qwen3-8B, qui atteint 86 % sur AIME 2024 tout en s'exécutant efficacement sur un Nvidia H100.