DeepSeek telah merilis pembaruan signifikan untuk model DeepSeek-R1-0528, meningkatkan kemampuan penalarannya dan menutup kesenjangan kinerja dengan model proprietari terkemuka dari OpenAI dan Google. Pembaruan ini memanfaatkan algoritma yang ditingkatkan dan daya komputasi yang lebih besar untuk meningkatkan akurasi di berbagai benchmark matematika, pemrograman, dan logika tanpa mengubah arsitektur intinya.

  • Pada AIME 2025, akurasi naik dari 70% menjadi 87,5%, sementara rata-rata token prompt meningkat dari 12.000 menjadi 23.000.
  • Benchmark matematika mencatatkan kenaikan pada AIME 2024 (79,8% menjadi 91,4%), HMMT 2025 (41,7% menjadi 79,4%), dan CNMO 2024 (78,8% menjadi 86,9%).
  • Kinerja pemrograman membaik pada LiveCodeBench (63,5% menjadi 73,3%) dan Aider-Polyglot (53,3% menjadi 71,6%), dengan peningkatan peringkat Codeforces dari 1530 menjadi 1930.
  • Skor pengetahuan umum meningkat pada GPQA-Diamond (71,5% menjadi 81,0%) dan Humanity's Last Exam (8,5% menjadi 17,7%).
  • Platform independen Artificial Analysis memberi peringkat model ini sebesar 68, menempatkannya di atas Llama 4 Maverick dari Meta dan Qwen3 253 dari Alibaba.

Pembaruan ini menunjukkan bahwa model dengan bobot terbuka dapat mencapai kinerja yang kompetitif melalui peningkatan pasca-pelatihan dengan pembelajaran penguatan. DeepSeek juga merilis versi distilasi, DeepSeek-R1-0528-Qwen3-8B, yang mencapai 86% pada AIME 2024 sambil berjalan secara efisien di Nvidia H100.