Kimi K3 telah memimpin papan peringkat FullStack baru di arena.ai.
Model tersebut mencapai posisi teratas pada benchmark yang baru diperkenalkan ini.
Kimi K3 telah memimpin papan peringkat FullStack baru di arena.ai.
Model tersebut mencapai posisi teratas pada benchmark yang baru diperkenalkan ini.
Seorang pengguna mengevaluasi Kimi K3 terhadap Claude Opus 4.8 dengan menjalankan 34 prompt satu-sentuhan dan menilai HTML, tangkapan layar, dan GIF yang dihasilkan menggunakan Sonnet 4.6. Evaluasi menyimpulkan bahwa Kimi K3 menghasilkan hasil yang lebih baik daripada Opus 4.8.
Perbandingan antara Kimi K3 dan GPT-5.6 Sol pada benchmark DeepSWE menunjukkan bahwa meskipun GPT-5.6 Sol unggul dalam kualitas single-shot (72,7% vs 68,5%), Kimi K3 mencapai skor pass@k yang lebih tinggi untuk k > 1 dengan biaya yang jauh lebih rendah.
Kimi K3, model berbobot terbuka dari Moonshot AI, mencapai kinerja yang sebanding dengan Claude Fable 5 dari Anthropic pada benchmark DeepSWE sambil membutuhkan biaya jauh lebih sedikit per tugas. Dalam evaluasi tanggal 16 Juli 2026, Kimi K3 mencapai pass@1 sebesar 68,5% dibandingkan 69,9% untuk Fable 5, namun mengunggulinya dalam skenario multi-percobaan dan menawarkan efisiensi biaya yang lebih unggul.
Rilis Kimi-K3 telah mengurangi jeda waktu antara frontier AI open-source dan closed-source menjadi hanya 1,5 bulan, menurut Artificial Analysis.
Menurut papan peringkat Agent Arena, Kimi K3 berkinerja setara dengan Opus dalam tugas non-visi. Meskipun beberapa pengguna mencatat bahwa Opus mungkin memiliki keunggulan dalam kemampuan visi, peringkat menunjukkan kesetaraan untuk kasus penggunaan lainnya.
Kami menggunakan cookie untuk mengukur lalu lintas dan meningkatkan situs. Anda dapat menerima atau menolak cookie analitik. Kebijakan privasi