Peneliti memperkenalkan Seed1.5-Thinking, sebuah model Mixture-of-Experts dengan 20B parameter aktif dan 200B total yang bernalar sebelum merespons. Metode ini mencapai 86.7 pada AIME 2024, 55.0 pada Codeforces, dan 77.3 pada GPQA, menunjukkan kemampuan penalaran yang kuat di bidang STEM dan pemrograman.

  • Mengungguli DeepSeek R1 sebesar 8% dalam tingkat kemenangan pada tugas non-penalaran.
  • Mengembangkan dua benchmark internal, BeyondAIME dan Codeforces, untuk menilai penalaran umum.

Model ini menunjukkan generalisasi yang nyata di berbagai domain, mengindikasikan penerapan yang lebih luas di luar tugas penalaran murni.