A DeepSeek lançou uma atualização significativa para seu modelo DeepSeek-R1-0528, aprimorando suas capacidades de raciocínio e reduzindo a lacuna de desempenho em relação aos principais modelos proprietários da OpenAI e do Google. A atualização utiliza algoritmos melhorados e maior poder computacional para aumentar a precisão em benchmarks de matemática, programação e lógica, sem alterar a arquitetura principal.
- No AIME 2025, a precisão subiu de 70% para 87,5%, enquanto o número médio de tokens do prompt aumentou de 12.000 para 23.000.
- Os benchmarks de matemática registraram avanços no AIME 2024 (de 79,8% para 91,4%), HMMT 2025 (de 41,7% para 79,4%) e CNMO 2024 (de 78,8% para 86,9%).
- O desempenho de programação melhorou no LiveCodeBench (de 63,5% para 73,3%) e no Aider-Polyglot (de 53,3% para 71,6%), com aumento da classificação no Codeforces de 1530 para 1930.
- As pontuações de conhecimento geral aumentaram no GPQA-Diamond (de 71,5% para 81,0%) e no Humanity's Last Exam (de 8,5% para 17,7%).
- A plataforma independente Artificial Analysis classificou o modelo em 68, posicionando-o à frente do Llama 4 Maverick da Meta e do Qwen3 253 da Alibaba.
A atualização demonstra que modelos de pesos abertos podem alcançar desempenho competitivo por meio de maior pós-treinamento com aprendizado por reforço. A DeepSeek também lançou uma versão destilada, DeepSeek-R1-0528-Qwen3-8B, que alcança 86% no AIME 2024 enquanto opera com eficiência em uma Nvidia H100.