Une comparaison entre DeepSeek-V4 Flash 0731 et GPT-5.6 Luna sur le benchmark DeepSWE révèle que, bien que GPT-5.6 Luna soit l'ingénieur le plus performant, une stratégie en cascade utilisant les deux modèles atteint une précision supérieure à un coût moindre.
- GPT-5.6 Luna mène de manière décisive le pass@1 de DeepSWE avec 67,2 % contre 53,3 % pour DeepSeek, maintenant son avance à chaque nombre d'essais égal.
- DeepSeek-V4 Flash est le modèle le moins cher disponible à 0,10 $ par rollout, offrant 532 résolutions pour 100 $ contre 110 pour Luna.
- Exécuter DeepSeek en premier et basculer vers Luna uniquement en cas d'échec permet de résoudre 78,9 % des tâches à 0,385 $ chacune, surpassant Luna seul tant en précision qu'en coût.
- DeepSeek échoue plus proprement, cassant la suite de tests existante du dépôt dans 9 % des échecs contre 15 % pour Luna.
L'approche en cascade exploite le faible prix de DeepSeek pour résoudre environ la moitié des tâches, permettant au modèle phare de se concentrer sur les problèmes plus difficiles pour un résultat combiné qui dépasse celui obtenu avec chaque modèle utilisé seul.