Los investigadores presentan Seed1.5-Thinking, un modelo Mixture-of-Experts con 20B de parámetros activados y 200B totales que razona antes de responder. El método alcanza 86.7 en AIME 2024, 55.0 en Codeforces y 77.3 en GPQA, demostrando fuertes capacidades de razonamiento en STEM y programación.
- Supera a DeepSeek R1 en un 8% en tasa de victoria en tareas no de razonamiento.
- Desarrolla dos benchmarks internos, BeyondAIME y Codeforces, para evaluar el razonamiento generalizado.
El modelo demuestra una generalización notable en diversos dominios, lo que indica una aplicabilidad más amplia más allá de las tareas puras de razonamiento.