Una comparación de DeepSeek-V4 Flash 0731 y GPT-5.6 Luna en el benchmark DeepSWE revela que, aunque GPT-5.6 Luna es el ingeniero más fuerte, una estrategia en cascada que utiliza ambos modelos logra mayor precisión a menor costo.

  • GPT-5.6 Luna lidera decisivamente en DeepSWE pass@1 con un 67,2 % frente al 53,3 % de DeepSeek, manteniendo su ventaja en cada conteo de intentos igual.
  • DeepSeek-V4 Flash es el modelo más económico disponible a $0,10 por rollout, ofreciendo 532 resoluciones por cada $100 en comparación con las 110 de Luna.
  • Ejecutar primero DeepSeek y escalar a Luna solo en caso de fallo resuelve el 78,9 % de las tareas a un costo de $0,385 cada una, superando a Luna sola tanto en precisión como en costo.
  • DeepSeek falla de manera más limpia, rompiendo la suite de pruebas existente del repositorio en el 9 % de los fallos frente al 15 % de Luna.

El enfoque en cascada aprovecha el bajo precio de DeepSeek para resolver aproximadamente la mitad de las tareas, permitiendo que el modelo insignia se centre en problemas más difíciles para obtener un resultado combinado que supera a cualquiera de los modelos utilizados por separado.