DeepSeek выпустила значительное обновление для своей модели DeepSeek-R1-0528, улучшив её способности к рассуждению и сократив разрыв в производительности с ведущими проприетарными моделями от OpenAI и Google. Обновление использует улучшенные алгоритмы и увеличенные вычислительные мощности для повышения точности на бенчмарках по математике, программированию и логике без изменения базовой архитектуры.

  • На AIME 2025 точность выросла с 70% до 87.5%, в то время как среднее количество токенов в промпте увеличилось с 12 000 до 23 000.
  • Бенчмарки по математике показали рост на AIME 2024 (с 79.8% до 91.4%), HMMT 2025 (с 41.7% до 79.4%) и CNMO 2024 (с 78.8% до 86.9%).
  • Производительность в программировании улучшилась на LiveCodeBench (с 63.5% до 73.3%) и Aider-Polyglot (с 53.3% до 71.6%), а рейтинг Codeforces вырос с 1530 до 1930.
  • Оценки общих знаний увеличились на GPQA-Diamond (с 71.5% до 81.0%) и Humanity's Last Exam (с 8.5% до 17.7%).

Независимая платформа Artificial Analysis оценила модель в 68 баллов, поставив её выше Meta Llama 4 Maverick и Alibaba Qwen3 253.

Обновление демонстрирует, что модели с открытыми весами могут достигать конкурентоспособной производительности за счёт увеличения постобучения с подкреплением. DeepSeek также выпустила дистиллированную версию DeepSeek-R1-0528-Qwen3-8B, которая показывает 86% на AIME 2024, эффективно работая на Nvidia H100.