Kimi K3, model berbobot terbuka dari Moonshot AI, mencapai kinerja yang sebanding dengan Claude Fable 5 dari Anthropic pada benchmark DeepSWE sambil membutuhkan biaya jauh lebih sedikit per tugas. Dalam evaluasi tanggal 16 Juli 2026, Kimi K3 mencapai pass@1 sebesar 68,5% dibandingkan 69,9% untuk Fable 5, namun mengunggulinya dalam skenario multi-percobaan dan menawarkan efisiensi biaya yang lebih unggul.
- Kimi K3 menelan biaya $4,65 per rollout versus $13,41 untuk Claude Fable 5, menghasilkan 2,8x lebih banyak tugas terselesaikan per dolar.
- Meskipun Fable 5 memimpin dalam keandalan percobaan tunggal (69,9% vs 68,5%), Kimi K3 menang pada pass@2 (82,0% vs 80,2%) dan pass@4 (89,4% vs 88,5%).
- Kimi K3 mencakup rentang tugas yang lebih luas, menyelesaikan 101 tugas unik dibandingkan 107 untuk Fable 5, dengan kinerja kuat di Go.
- Model-model ini menunjukkan korelasi tinggi (0,72) dan pola kegagalan yang serupa, artinya mereka tidak memberikan keragaman signifikan ketika dipasangkan.
Kimi K3 diposisikan sebagai pilihan rasional default untuk pekerjaan agen bervolume tinggi atau toleran terhadap percobaan ulang karena sifat berbobot terbukanya dan biaya yang lebih rendah, meskipun Fable 5 memiliki keunggulan kecil dalam keandalan percobaan tunggal.