Perbandingan antara Kimi K3 dan GPT-5.6 Sol pada benchmark DeepSWE menunjukkan bahwa meskipun GPT-5.6 Sol unggul dalam kualitas single-shot (72,7% vs 68,5%), Kimi K3 mencapai skor pass@k yang lebih tinggi untuk k > 1 dengan biaya yang jauh lebih rendah.

  • Kimi K3 menang di pass@2 (82,0% vs 81,0%) dan pass@4 (89,4% vs 85,8%), mencapai pass@4 terbaik dari konfigurasi kelas flagship manapun.
  • Biaya Kimi K3 adalah $4,65 per rollout dibandingkan dengan $8,37 untuk GPT-5.6 Sol, memberikan 2,8x lebih banyak tugas yang diselesaikan per dolar.
  • Model-model ini menyimpang secara signifikan (korelasi 0,46) dan gagal dengan cara berbeda, memungkinkan kaskade Kimi-first dengan eskalasi ke Sol untuk mencakup 108 dari 113 tugas.
  • GPT-5.6 Sol lebih andal, menyelesaikan 61 tugas empat-untuk-empat dibandingkan dengan 45 untuk Kimi K3, tetapi membutuhkan waktu lebih lama per rollout (17 menit vs 66 menit).

Pengalihan antara kedua model ini memberikan solusi praktis yang kuat, dengan kaskade Kimi-first mencapai akurasi sekitar 85,6% sambil lebih murah daripada menggunakan GPT-5.6 Sol saja.