Une comparaison entre Kimi K3 et GPT-5.6 Sol sur le benchmark DeepSWE révèle que, bien que GPT-5.6 Sol domine en qualité en un seul essai (72,7 % contre 68,5 %), Kimi K3 obtient des scores pass@k supérieurs pour k > 1 à un coût nettement inférieur.
- Kimi K3 remporte le pass@2 (82,0 % contre 81,0 %) et le pass@4 (89,4 % contre 85,8 %), atteignant le meilleur pass@4 de toute configuration de niveau flagship.
- Kimi K3 coûte 4,65 $ par rollout contre 8,37 $ pour GPT-5.6 Sol, offrant 2,8 fois plus de tâches résolues par dollar.
- Les modèles divergent significativement (corrélation de 0,46) et échouent différemment, permettant une cascade Kimi-first avec escalation vers Sol pour couvrir 108 des 113 tâches.
- GPT-5.6 Sol est plus fiable, résolvant 61 tâches quatre fois sur quatre contre 45 pour Kimi K3, mais prend plus de temps par rollout (17 minutes contre 66 minutes).
Le routage entre les deux modèles offre une solution pratique solide, avec une cascade Kimi-first atteignant environ 85,6 % de précision tout en étant moins coûteuse que l'utilisation exclusive de GPT-5.6 Sol.