Una comparación entre DeepSeek V4 Pro 0813 y GPT-5.6 Sol en el benchmark DeepSWE demuestra que ejecutar primero a DeepSeek y escalar a GPT-5.6 Sol ante un fallo en la prueba logra una tasa de éxito del 83,0% por $3.35 por tarea.

  • DeepSeek V4 Pro 0813 cuesta $0.24 por rollout, lo que lo hace 35 veces más barato que el precio de $8.37 de GPT-5.6 Sol.
  • Aunque GPT-5.6 Sol lidera la precisión en un solo intento con una tasa pass@1 del 72,7%, DeepSeek V4 Pro 0813 lo supera a cuatro intentos con una puntuación pass@4 del 88,5%.
  • La estrategia de cascada supera a ambos modelos ejecutados por separado y mejora a un enrutador oráculo perfecto de un solo intento al lograr el 83,0% de cobertura por menos de la mitad del costo por tarea de GPT-5.6 Sol.
  • GPT-5.6 Sol sigue siendo superior para tareas sensibles a la latencia, completando rollouts en 17 minutos en comparación con los 35 minutos de DeepSeek, y gana seis de ocho dominios de tareas, incluyendo Python y Go.

Este enfoque de enrutamiento permite a los usuarios aprovechar a DeepSeek V4 Pro 0813 como una capa frontal de bajo costo que resuelve la mayoría de las cargas de trabajo, reservando el costoso GPT-5.6 Sol solo para tareas difíciles que requieren su mayor precisión.