Proyek llama.cpp telah menambahkan dukungan untuk model teks Kimi-K3, mengimplementasikan arsitektur perhatian hibrida KDA (linear) + MLA (penuh) bersama dengan lima fitur arsitektur spesifik yang tidak ada pada Kimi-Linear-48B yang lebih lama.

  • Implementasi mencakup perhatian residual lintas-lapis, MoE laten, aktivasi situ yang menggantikan SwiGLU, gerbang keluaran MLA, dan gerbang KDA berderajat penuh.
  • Ahli yang dialihkan dikirim sebagai tensor terkompresi menggunakan format "mxfp4-pack-quantized", yang kompatibel-bit dengan MXFP4 ggml untuk memungkinkan repacking tanpa kehilangan data tanpa dekuantisasi.
  • Template obrolan baru menangani format bertanda XTML-ish Kimi-K3 untuk penalaran, konten, dan panggilan alat, termasuk pembatas pesan spesifik dan pemisahan rentang tingkat token.
  • Konverter memperbaiki kesalahan tipe dan meningkatkan LLAMA_MAX_EXPERTS dari 512 menjadi 1024, sementara penyimpan model sekarang secara benar mengeluarkan parameter kda_gate_lower_bound untuk mempertahankan kesetiaan roundtrip.

Pembaruan ini memungkinkan pengguna menjalankan Kimi-K3 secara lokal dengan kebenaran end-to-end yang terverifikasi terhadap implementasi referensi Moonshot dan data generasi nyata.