Perbandingan antara DeepSeek-V4 Flash 0731 dan GPT-5.6 Luna pada benchmark DeepSWE mengungkapkan bahwa meskipun GPT-5.6 Luna adalah insinyur yang lebih kuat, strategi kaskade yang menggunakan kedua model mencapai akurasi lebih tinggi dengan biaya lebih rendah.
- GPT-5.6 Luna memimpin DeepSWE pass@1 secara tegas sebesar 67,2% versus 53,3% milik DeepSeek, mempertahankan keunggulannya pada setiap jumlah percobaan yang sama.
- DeepSeek-V4 Flash adalah model termurah di antara yang tersedia dengan harga $0,10 per rollout, menghasilkan 532 solusi per $100 dibandingkan 110 milik Luna.
- Menjalankan DeepSeek terlebih dahulu dan meningkatkan ke Luna hanya saat gagal menyelesaikan 78,9% tugas dengan biaya $0,385 per tugas, mengalahkan Luna sendiri dalam hal akurasi dan biaya.
- DeepSeek gagal secara lebih bersih, merusak suite pengujian yang ada di repositori pada 9% dari kegagalan dibandingkan 15% milik Luna.
Pendekatan kaskade memanfaatkan harga rendah DeepSeek untuk menyelesaikan sekitar setengah dari tugas-tugas tersebut, memungkinkan model unggulan fokus pada masalah yang lebih sulit untuk menghasilkan hasil gabungan yang mengungguli penggunaan masing-masing model secara terpisah.