연구원들은 Seed1.5-Thinking을 소개했으며, 이는 응답하기 전에 사고를 통해 추론하는 20B의 활성화 파라미터와 200B의 총 파라미터를 가진 Mixture-of-Experts 모델입니다. 이 방법은 AIME 2024에서 86.7, Codeforces에서 55.0, GPQA에서 77.3을 달성하여 STEM 및 코딩 분야에서 강력한 추론 능력을 입증했습니다.
- 비추론 작업에서 승률로 DeepSeek R1보다 8% 더 높습니다.
- 일반화된 추론을 평가하기 위해 BeyondAIME과 Codeforces라는 두 가지 내부 벤치마크를 개발했습니다.
이 모델은 다양한 도메인에서 주목할 만한 일반화를 보여주며, 순수 추론 작업을 넘어 더 넓은 적용 가능성을 나타냅니다.