Pesquisadores apresentam o Seed1.5-Thinking, um modelo Mixture-of-Experts com 20B de parâmetros ativados e 200B totais que raciocina antes de responder. O método alcança 86.7 no AIME 2024, 55.0 no Codeforces e 77.3 no GPQA, demonstrando fortes capacidades de raciocínio em STEM e programação.
- Supera o DeepSeek R1 em 8% na taxa de vitória em tarefas não relacionadas ao raciocínio.
- Desenvolve dois benchmarks internos, BeyondAIME e Codeforces, para avaliar o raciocínio generalizado.
O modelo demonstra generalização notável em diversos domínios, indicando aplicabilidade mais ampla além de tarefas puras de raciocínio.