DeepSWE 벤치마크에서 DeepSeek-V4 Flash 0731과 GPT-5.6 Luna를 비교한 결과, GPT-5.6 Luna가 더 강력한 엔지니어이지만 두 모델을 모두 사용하는 캐스케이드 전략이 더 낮은 비용으로 더 높은 정확도를 달성합니다.
- GPT-5.6 Luna는 DeepSWE pass@1에서 67.2%로 DeepSeek의 53.3%를 압도하며, 동일한 시도 횟수마다 우위를 유지합니다.
- DeepSeek-V4 Flash은 롤아웃당 $0.10으로 가장 저렴한 모델이며, $100당 532개의 해결을 제공하는 반면 Luna는 110개에 그칩니다.
- DeepSeek를 먼저 실행하고 실패 시에만 Luna로 승격하면 각 작업당 $0.385로 78.9%의 작업을 해결하며, Luna 단독 사용보다 정확도와 비용 모두에서 우수합니다.
- DeepSeek는 더 깔끔하게 실패하며, 기존 테스트 스위트가 깨지는 비율은 Luna의 15% 대비 실패 시 9%입니다.
이 캐스케이드 접근 방식은 DeepSeek의 낮은 가격을 활용하여 약 절반의 작업을 처리하고, 플래그십 모델이 더 어려운 문제에 집중할 수 있게 하여 단독 사용 시 어느 모델보다 우수한 결과를 도출합니다.