DeepSeek已对其DeepSeek-R1-0528模型发布重大更新,增强了其推理能力,并缩小了与OpenAI和Google领先专有模型之间的性能差距。该更新利用改进的算法和更强的计算能力,在不改变核心架构的情况下提升了数学、编码和逻辑基准测试的准确性。
- 在AIME 2025上,准确率从70%提升至87.5%,平均提示词元数从12,000增至23,000。
- 数学基准测试在AIME 2024(79.8%至91.4%)、HMMT 2025(41.7%至79.4%)和CNMO 2024(78.8%至86.9%)上均取得提升。
- 编码性能在LiveCodeBench(63.5%至73.3%)和Aider-Polyglot(53.3%至71.6%)上得到改善,Codeforces评级从1530提升至1930。
- 通用知识得分在GPQA-Diamond(71.5%至81.0%)和Humanity's Last Exam(8.5%至17.7%)上有所提高。
- 独立平台Artificial Analysis对该模型评分为68,使其排名超越Meta的Llama 4 Maverick和Alibaba的Qwen3 253。
此次更新表明,通过增加强化学习的后训练,开放权重模型可以实现具有竞争力的性能。DeepSeek还发布了一个蒸馏版本DeepSeek-R1-0528-Qwen3-8B,该模型在AIME 2024上达到86%的得分,同时在Nvidia H100上高效运行。