DeepSWEベンチマークにおけるKimi K3とGPT-5.6 Solの比較により、GPT-5.6 Solが一発での品質(72.7%対68.5%)でリードしているものの、Kimi K3はk > 1に対してpass@kスコアをより高いコスト効率で達成することが明らかになった。
- Kimi K3はpass@2(82.0%対81.0%)とpass@4(89.4%対85.8%)で勝利し、フラッグシップティアの構成の中で最高のpass@4を記録した。
- Kimi K3のロールアウトあたりのコストは$4.65であり、GPT-5.6 Solの$8.37と比較して、1ドルあたりに解決できるタスクが2.8倍多い。
- 両モデルは有意に乖離しており(相関0.46)、異なる方法で失敗するため、Kimiを優先しSolへエスカレーションするカスケードにより、113タスク中108をカバーできる。
- GPT-5.6 Solはより信頼性が高く、61タスクを4回すべて解決したのに対し、Kimi K3は45タスクであったが、ロールアウトあたりの所要時間が長い(17分対66分)。
両モデル間のルーティングは実用的な強力な解決策を提供し、Kimi優先のカスケードは約85.6%の精度を達成しつつ、GPT-5.6 Sol単独で使用するよりも安価である。