DeepSeek ha lanzado una actualización significativa de su modelo DeepSeek-R1-0528, mejorando sus capacidades de razonamiento y reduciendo la brecha de rendimiento frente a los principales modelos propietarios de OpenAI y Google. La actualización utiliza algoritmos mejorados y mayor potencia computacional para aumentar la precisión en benchmarks de matemáticas, programación y lógica sin alterar la arquitectura base.
- En AIME 2025, la precisión aumentó del 70% al 87,5%, mientras que el promedio de tokens por prompt subió de 12.000 a 23.000.
- Los benchmarks de matemáticas registraron mejoras en AIME 2024 (de 79,8% a 91,4%), HMMT 2025 (de 41,7% a 79,4%) y CNMO 2024 (de 78,8% a 86,9%).
- El rendimiento en programación mejoró en LiveCodeBench (de 63,5% a 73,3%) y Aider-Polyglot (de 53,3% a 71,6%), con un aumento de la calificación en Codeforces de 1530 a 1930.
- Las puntuaciones de conocimiento general aumentaron en GPQA-Diamond (de 71,5% a 81,0%) y Humanity's Last Exam (de 8,5% a 17,7%).
- La plataforma independiente Artificial Analysis calificó al modelo con 68, ubicándolo por delante de Llama 4 Maverick de Meta y Qwen3 253 de Alibaba.
La actualización demuestra que los modelos de peso abierto pueden alcanzar un rendimiento competitivo mediante un mayor post-entrenamiento con aprendizaje por refuerzo. DeepSeek también lanzó una versión destilada, DeepSeek-R1-0528-Qwen3-8B, que alcanza el 86% en AIME 2024 mientras se ejecuta de manera eficiente en una Nvidia H100.