Les chercheurs présentent Seed1.5-Thinking, un modèle Mixture-of-Experts avec 20B de paramètres activés et 200B au total qui raisonne avant de répondre. La méthode atteint 86.7 sur AIME 2024, 55.0 sur Codeforces et 77.3 sur GPQA, démontrant de solides capacités de raisonnement en STEM et en programmation.
- Dépasse DeepSeek R1 de 8 % en taux de victoire sur les tâches non liées au raisonnement.
- Développe deux benchmarks internes, BeyondAIME et Codeforces, pour évaluer le raisonnement généralisé.
Le modèle démontre une généralisation notable dans divers domaines, indiquant une applicabilité plus large au-delà des tâches de raisonnement pur.