Moonshot AI telah memperkenalkan Kimi K3, model Mixture-of-Experts sumber terbuka yang memiliki total 2,8 triliun parameter dan 104 miliar parameter aktif per token. Model ini mendukung kemampuan visi asli dan jendela konteks 1 juta token, memanfaatkan Kimi Delta Attention dan Stable LatentMoE untuk mencapai efisiensi penskalaan sekitar 2,5x dibandingkan pendahulunya, Kimi K2.

  • Kimi K3 memanfaatkan Kimi Delta Attention dan Residuals Attention untuk meningkatkan aliran informasi sepanjang panjang sekuens dan kedalaman model.
  • Stable LatentMoE secara efektif mengaktifkan 16 dari 896 ahli yang dialihkan per token.
  • Pasca-pelatihan mencakup pembelajaran penguatan di domain umum, agentic, dan pemrograman dengan berbagai tingkat usaha penalaran.
  • Model ini mencapai kinerja tingkat terdepan dalam tugas kode jangka panjang, agentic, pengetahuan, penalaran, dan visi.
  • Meskipun tertinggal dari Claude Fable 5 dan GPT-5.6 Sol, model ini mengungguli model sumber terbuka dan tertutup lain yang dievaluasi.

Moonshot AI merilis bobot model Kimi K3 lengkap untuk memfasilitasi penelitian di masa depan dan mempercepat penyebaran kecerdasan tingkat terdepan secara lebih luas.