研究者らは、20Bのアクティベートパラメータと200Bの総パラメータを持つMixture-of-ExpertsモデルであるSeed1.5-Thinkingを発表しました。これは応答する前に思考を通じて推論を行います。この手法はAIME 2024で86.7、Codeforcesで55.0、GPQAで77.3を達成し、STEMおよびコーディングにおける強力な推論能力を示しています。
- 非推論タスクでの勝率においてDeepSeek R1を8%上回ります。
- 汎化された推論を評価するために、BeyondAIMEとCodeforcesの2つの内部ベンチマークを開発しました。
このモデルは多様なドメインにわたって顕著な汎化能力を示しており、純粋な推論タスクを超えたより広い適用可能性を示唆しています。