DeepSWEベンチマークにおけるDeepSeek-V4 Flash 0731とGPT-5.6 Lunaの比較により、GPT-5.6 Lunaがより強力なエンジニアである一方で、両モデルを用いたカスケード戦略は、より低いコストでより高い精度を達成することが明らかになった。
- GPT-5.6 LunaはDeepSWEのpass@1で67.2%とDeepSeekの53.3%を大きく上回り、試行回数がいかなる等しい場合でもそのリードを維持している。
- DeepSeek-V4 Flashはロールアウトあたり0.10ドルという最安値モデルであり、100ドルあたり110件の解決を提供するLunaと比較して532件の解決を実現している。
- まずDeepSeekを実行し、失敗した場合のみLunaにエスカレーションすることで、タスクの78.9%を各0.385ドルで解決し、Luna単独よりも精度とコストの両面で優れている。
- DeepSeekはよりクリーンに失敗し、失敗時の9%でリポジトリの既存テストスイートを壊すのに対し、Lunaでは15%である。
カスケードアプローチは、DeepSeekの低価格を活用してタスクのおよそ半分を処理し、フラッグシップモデルがより困難な問題に集中することを可能にし、単独で使用されるいずれかのモデルを上回る結果をもたらす。