Исследователи представляют Seed1.5-Thinking, модель Mixture-of-Experts с 20B активированных и 200B общих параметров, которая рассуждает перед ответом. Метод достигает 86.7 на AIME 2024, 55.0 на Codeforces и 77.3 на GPQA, демонстрируя сильные способности к рассуждениям в STEM и программировании.

  • Превосходит DeepSeek R1 на 8% по проценту побед на задачах, не требующих рассуждений.
  • Разрабатывает два внутренних бенчмарка, BeyondAIME и Codeforces, для оценки обобщенных рассуждений.

Модель демонстрирует заметную обобщающую способность в различных областях, что указывает на более широкую применимость за пределами задач чистого рассуждения.