Una comparación entre Kimi K3 y GPT-5.6 Sol en el benchmark DeepSWE revela que, aunque GPT-5.6 Sol lidera en calidad de intento único (72.7% frente a 68.5%), Kimi K3 logra puntuaciones pass@k más altas para k > 1 con un costo significativamente menor.

  • Kimi K3 gana en pass@2 (82.0% frente a 81.0%) y pass@4 (89.4% frente a 85.8%), alcanzando el mejor pass@4 de cualquier configuración de gama alta.
  • Kimi K3 cuesta $4.65 por rollout en comparación con los $8.37 de GPT-5.6 Sol, ofreciendo 2.8 veces más tareas resueltas por dólar.
  • Los modelos divergen significativamente (correlación de 0.46) y fallan de manera diferente, lo que permite una cascada con Kimi primero y escalación a Sol para cubrir 108 de las 113 tareas.
  • GPT-5.6 Sol es más fiable, resolviendo 61 tareas cuatro veces de cuatro frente a las 45 de Kimi K3, pero tarda más por rollout (17 minutos frente a 66 minutos).

El enrutamiento entre los dos modelos proporciona una solución práctica sólida, con una cascada que prioriza a Kimi alcanzando aproximadamente un 85.6% de precisión mientras es más económica que usar solo GPT-5.6 Sol.