DeepSeek는 DeepSeek-R1-0528 모델에 중요한 업데이트를 출시하여 추론 능력을 강화하고 OpenAI와 Google의 주요 독점 모델들과의 성능 격차를 좁혔습니다. 이 업데이트는 핵심 아키텍처를 변경하지 않고 수학, 코딩, 논리 벤치마크 전반의 정확도를 높이기 위해 개선된 알고리즘과 증가된 컴퓨팅 파워를 활용합니다.
- AIME 2025에서 정확도가 70%에서 87.5%로 상승했으며, 평균 프롬프트 토큰 수는 12,000에서 23,000으로 증가했습니다.
- 수학 벤치마크에서는 AIME 2024 (79.8%에서 91.4%), HMMT 2025 (41.7%에서 79.4%), CNMO 2024 (78.8%에서 86.9%)에서 향상되었습니다.
- 코딩 성능은 LiveCodeBench (63.5%에서 73.3%)와 Aider-Polyglot (53.3%에서 71.6%)에서 개선되었으며, Codeforces 등급은 1530에서 1930으로 상승했습니다.
- 일반 지식 점수는 GPQA-Diamond (71.5%에서 81.0%)와 Humanity's Last Exam (8.5%에서 17.7%)에서 증가했습니다.
- 독립 플랫폼 Artificial Analysis는 이 모델에 68점을 부여하여 Meta의 Llama 4 Maverick과 Alibaba의 Qwen3 253보다 앞선다고 평가했습니다.
이 업데이트는 오픈 가중치 모델이 강화 학습을 통한 후처리 증대를 통해 경쟁력 있는 성능을 달성할 수 있음을 보여줍니다. DeepSeek는 또한 AIME 2024에서 86%의 점수를 달성하면서 Nvidia H100 위에서 효율적으로 실행되는 압축 버전인 DeepSeek-R1-0528-Qwen3-8B도 출시했습니다.