Uma comparação entre DeepSeek-V4 Flash 0731 e GPT-5.6 Luna no benchmark DeepSWE revela que, embora GPT-5.6 Luna seja o engenheiro mais forte, uma estratégia em cascata usando ambos os modelos alcança maior precisão a um custo menor.
- GPT-5.6 Luna lidera decisivamente o DeepSWE pass@1 com 67,2% contra 53,3% do DeepSeek, mantendo sua vantagem em cada contagem de tentativas iguais.
- DeepSeek-V4 Flash é o modelo mais barato disponível a $0,10 por rollout, entregando 532 resoluções por $100 em comparação com as 110 da Luna.
- Executar o DeepSeek primeiro e escalar para a Luna apenas em caso de falha resolve 78,9% das tarefas a $0,385 cada, superando a Luna sozinha tanto em precisão quanto em custo.
- O DeepSeek falha de forma mais limpa, quebrando o conjunto de testes existente do repositório em 9% dos casos de falha contra 15% da Luna.
A abordagem em cascata aproveita o baixo preço do DeepSeek para resolver aproximadamente metade das tarefas, permitindo que o modelo principal se concentre em problemas mais difíceis para um resultado combinado que supera qualquer um dos modelos usados isoladamente.