DeepSeek ने अपने DeepSeek-R1-0528 मॉडल में एक महत्वपूर्ण अपडेट जारी किया है, जिसने इसकी तर्कशक्ति क्षमताओं को बढ़ाया है और OpenAI तथा Google से प्रमुख स्वामित्व वाले मॉडल्स के साथ प्रदर्शन के अंतर को कम किया है। यह अपडेट कोर आर्किटेक्चर में कोई बदलाव किए बिना गणित, कोडिंग और तर्क बेंचमार्क्स में सटीकता बढ़ाने के लिए सुधारे गए एल्गोरिदम और बढ़ी हुई कंप्यूटिंग शक्ति का उपयोग करता है।

  • AIME 2025 पर, सटीकता 70% से बढ़कर 87.5% हो गई, जबकि औसत प्रॉम्प्ट टोकन 12,000 से बढ़कर 23,000 हो गए।
  • गणित बेंचमार्क्स में AIME 2024 (79.8% से 91.4%), HMMT 2025 (41.7% से 79.4%), और CNMO 2024 (78.8% से 86.9%) पर सुधार देखा गया।
  • LiveCodeBench (63.5% से 73.3%) और Aider-Polyglot (53.3% से 71.6%) पर कोडिंग प्रदर्शन में सुधार हुआ, साथ ही Codeforces रेटिंग 1530 से बढ़कर 1930 हो गई।
  • सामान्य ज्ञान स्कोर GPQA-Diamond (71.5% से 81.0%) और Humanity's Last Exam (8.5% से 17.7%) पर बढ़े।
  • स्वतंत्र प्लेटफॉर्म Artificial Analysis ने मॉडल को 68 रेटिंग दी, जिससे यह Meta के Llama 4 Maverick और Alibaba के Qwen3 253 से आगे आ गया।

यह अपडेट दर्शाता है कि खुले-वजन वाले मॉडल्स पुनर्प्रशिक्षण में प्रबल सीखने (reinforcement learning) के माध्यम से प्रतिस्पर्धी प्रदर्शन प्राप्त कर सकते हैं। DeepSeek ने एक संक्षिप्त संस्करण, DeepSeek-R1-0528-Qwen3-8B भी जारी किया है, जो Nvidia H100 पर कुशलतापूर्वक चलते हुए AIME 2024 पर 86% प्राप्त करता है।