Los investigadores presentan Seed1.5-Thinking, un modelo Mixture-of-Experts con 20B de parámetros activados y 200B totales que razona antes de responder. El método alcanza 86.7 en AIME 2024, 55.0 en Codeforces y 77.3 en GPQA, demostrando fuertes capacidades de razonamiento en STEM y programación.

  • Supera a DeepSeek R1 en un 8% en tasa de victoria en tareas no de razonamiento.
  • Desarrolla dos benchmarks internos, BeyondAIME y Codeforces, para evaluar el razonamiento generalizado.

El modelo demuestra una generalización notable en diversos dominios, lo que indica una aplicabilidad más amplia más allá de las tareas puras de razonamiento.