DeepSeek открыла исходный код DeepSeek-R1, большой языковой модели, дообученной с использованием обучения с подкреплением для улучшения способностей к рассуждению. Модель демонстрирует результаты на уровне OpenAI o1 на таких бенчмарках, как MATH-500 и SWE-bench.

  • Основанная на смеси экспертов DeepSeek-V3, она использует Group Relative Policy Optimization (GRPO) для обучения.
  • Команда решила проблему «холодного старта» RL, добавив контролируемое дообучение с примерами цепочки рассуждений перед обучением с подкреплением.
  • Были выпущены дистиллированные версии для Qwen и Llama, превосходящие более крупные модели, такие как GPT-4, в задачах по математике и программированию.
  • DeepSeek-R1 заняла #3 место в общем зачете LMArena вскоре после выпуска, лидируя в категориях программирования и математики.

Открытая лицензия разрешает использование выходных данных модели для дистилляции, что может продвинуть состояние искусства для языковых моделей всех размеров.