Kimi K3 telah mencapai posisi utama dalam evaluasi SpreadsheetBench 2 dari AfterQuery. Hasil ini menempatkannya di depan Claude Fable 5 dalam benchmark spesifik ini.
Kimi K3 menduduki peringkat #1 di SpreadsheetBench 2 AfterQuery, melampaui Claude Fable 5
Doctorina mengungguli dokter dalam diagnosis perawatan primer sintetis berbahasa Polandia
Sebuah studi membandingkan sistem AI klinis Doctorina dengan delapan dokter dan empat model bahasa frontier mandiri di seluruh 150 konsultasi perawatan primer sintetis berbahasa Polandia.
Kimi K3 mengungguli Opus 4.8 dalam generasi HTML satu-sentuhan
Seorang pengguna mengevaluasi Kimi K3 terhadap Claude Opus 4.8 dengan menjalankan 34 prompt satu-sentuhan dan menilai HTML, tangkapan layar, dan GIF yang dihasilkan menggunakan Sonnet 4.6. Evaluasi menyimpulkan bahwa Kimi K3 menghasilkan hasil yang lebih baik daripada Opus 4.8.
Kimi K3 menyamai Claude Fable 5 pada kualitas DeepSWE dengan biaya sepertiga
Kimi K3, model berbobot terbuka dari Moonshot AI, mencapai kinerja yang sebanding dengan Claude Fable 5 dari Anthropic pada benchmark DeepSWE sambil membutuhkan biaya jauh lebih sedikit per tugas. Dalam evaluasi tanggal 16 Juli 2026, Kimi K3 mencapai pass@1 sebesar 68,5% dibandingkan 69,9% untuk Fable 5, namun mengunggulinya dalam skenario multi-percobaan dan menawarkan efisiensi biaya yang lebih unggul.
Kimi K3 peringkat sama dengan Opus berpikir di Agent Arena
Menurut papan peringkat Agent Arena, Kimi K3 berkinerja setara dengan Opus dalam tugas non-visi. Meskipun beberapa pengguna mencatat bahwa Opus mungkin memiliki keunggulan dalam kemampuan visi, peringkat menunjukkan kesetaraan untuk kasus penggunaan lainnya.
Kimi K3 (max) mengalahkan Sonnet 5 di Simple Bench
Artikel tersebut melaporkan bahwa Kimi K3 (max) mengungguli Sonnet 5 pada benchmark Simple Bench.