Moonshot telah merilis detail lengkap, bobot, dan infrastruktur pendukung untuk Kimi K3, sebuah model Mixture-of-Experts dengan 2.8T parameter yang memiliki sekitar 104B parameter aktif per token. Rilis ini mencakup laporan teknis yang merinci tumpukan konteks panjang hibridanya serta alat baru seperti MoonEP, FlashKDA, dan AgentEnv.

  • Kimi K3 diskalakan sepanjang dimensi panjang, kedalaman, dan lebar menggunakan Kimi Delta Attention, Gated MLA, dan sparse LatentMoE, dilatih melalui distilasi on-policy multi-guru.
  • Komponen infrastruktur menjadi pusat dari rilis ini, dengan dukungan penyiapan dari NVIDIA untuk Dynamo dan Red Hat AI yang menyediakan checkpoint yang telah disetel untuk FP8-Block Hopper.
  • Analisis biaya menunjukkan kebutuhan perangkat keras yang signifikan, dengan konfigurasi minimum memerlukan 8x GPU MI355X dan penyajian produksi mungkin membutuhkan lebih dari 64 GPU dalam domain berbandwidth tinggi.
  • Rilis berbobot terbuka ini memicu adopsi cepat oleh penyedia seperti Perplexity, Baseten, dan Together, yang menawarkan opsi inferensi terhosting karena tingginya biaya penyiapan mandiri.

Rilis ini menegaskan bahwa bobot terbuka untuk model terdepan kini memerlukan investasi infrastruktur yang substansial, menggeser akses menuju penawaran terhosting daripada penyiapan mandiri sederhana.