DeepSWEベンチマークにおけるDeepSeek V4 Pro 0813とClaude Fable 5の比較により、両方のモデルを使用するルーティング戦略は、各タスクあたり$8.28で82.7%のタスクを解決し、Fable単独(69.7%)を上回り、大幅に安価であることが示された。
- Claude Fable 5は単一試行の精度(pass@1で69.7%)で首位であり、Rust(85%)やシリアライズが重い作業に優れているが、ロールアウトあたり$21.63のコストがかかり、DeepSeek V4 Pro 0813の約90倍である。
- DeepSeek V4 Pro 0813は低コスト(ロールアウトあたり$0.24)で、複数試行によりより高い精度(Fableの84.1%に対しpass@4で88.5%)を達成し、高ボリュームまたは再試行許容の作業においてより良い価値を提供する。
- 両モデルはタスクごとの相関が低く(0.39)、113タスクのうち107タスクをカバーしており、これはプロを最初に実行し、必要な場合にのみFableにエスカレーションするカスケードアプローチを正当化する。
分析により、Fable 5はデフォルトモデルではなくRustのような特定のドメインに対する選択的なエスカレーションとして使用するのが最適であり、DeepSeek V4 Pro 0813はコストの大幅な削減でFableに迫る精度を提供することが示唆された。