研究人员推出了 Seed1.5-Thinking,这是一个拥有 20B 激活参数和 200B 总参数的 Mixture-of-Experts 模型,它在回答前会进行推理。该方法在 AIME 2024 上达到 86.7 分,在 Codeforces 上达到 55.0 分,在 GPQA 上达到 77.3 分,展示了在 STEM 和编程方面的强大推理能力。
- 在非推理任务上的胜率比 DeepSeek R1 高出 8%。
- 开发了 BeyondAIME 和 Codeforces 两个内部基准测试,用于评估通用推理能力。
该模型在不同领域展现出显著的泛化能力,表明其应用范围超出了纯推理任务。