Компания DeepSeek выпустила модель DeepSeek-R1, большую языковую модель, обученную исключительно с помощью обучения с подкреплением для улучшения её способностей к рассуждению без опоры на демонстрации, размеченные человеком.

Модель демонстрирует возникающие продвинутые паттерны рассуждения, включая самоанализ, проверку и динамическую адаптацию стратегии. Она показывает превосходные результаты в задачах с проверяемым ответом по математике, соревнованиям по программированию и областям STEM по сравнению с моделями, обученными посредством обычного обучения с учителем. Кроме того, паттерны рассуждения, разработанные этой масштабной моделью, могут использоваться для руководства и улучшения более мелких моделей.

Этот подход демонстрирует, что только обучение с подкреплением может эффективно стимулировать сложное поведение рассуждения в LLM, снижая зависимость от обширных данных, размеченных человеком.