DeepSWEベンチマークにおけるDeepSeek V4 Pro 0813とGPT-5.6 Solの比較により、テスト失敗時にGPT-5.6 Solにエスカレーションする形でDeepSeekを最初に実行することで、タスクあたり$3.35で83.0%のパス率を実現できることが示された。
- DeepSeek V4 Pro 0813のロールアウトあたりのコストは$0.24であり、GPT-5.6 Solの$8.37という価格タグと比較して35倍安価である。
- GPT-5.6 Solは単一試行の精度でpass@1率72.7%をリードしているが、DeepSeek V4 Pro 0813は4回の試行でそれを上回り、pass@4スコア88.5%を達成した。
- このカスケード戦略は、両モデルを単独で実行するよりも優れており、GPT-5.6 Solのタスクあたりのコストの半分未満で83.0%のカバレッジを実現することで、完璧なワンショットオラクルルーティングを上回っている。
- GPT-5.6 Solはレイテンシに敏感なタスクにおいて依然として優れており、ロールアウト完了まで17分(DeepSeekの35分と比較)で完了し、PythonやGoを含む8つのタスクドメインのうち6つで勝利している。
このルーティングアプローチにより、ユーザーは大部分のワークロードを処理する低コストなフロントエンドとしてDeepSeek V4 Pro 0813を活用し、その高い精度を必要とする困難なタスクに対してのみ高価なGPT-5.6 Solを予約できる。