Artikel ini menguraikan urutan spesifik makalah penelitian dan laporan model untuk membantu pembaca memahami evolusi teknis di balik model Kimi K3 dari Moonshot AI. Artikel ini berargumen bahwa K3 bukan peluncuran yang terisolasi, melainkan konvergensi dari beberapa jalur penelitian berbeda, termasuk mekanisme perhatian linear dan desain Mixture-of-Experts yang jarang.

  • Linear Transformers Are Secretly Fast Weight Programmers: Menetapkan fondasi dengan menafsirkan perhatian linear sebagai sistem yang memperbarui memori asosiatif.
  • Gated DeltaNet (arXiv:2412.06464): Memperkenalkan pembaruan delta gerbang untuk meningkatkan manajemen keadaan pada urutan panjang.
  • Kimi Linear / Kimi Delta Attention (KDA): Menyajikan arsitektur perhatian linear hibrida yang berfungsi sebagai tulang punggung K3.
  • LatentMoE dan Stable LatentMoE: Menjelaskan formulasi perutean ruang laten dan evolusinya, yang memungkinkan K3 mengaktifkan 16 dari 896 ahli yang dirutekan per token.
  • Attention Residuals (arXiv:2603.15031): Menjelaskan mekanisme yang memungkinkan model memutuskan cara menggunakan jaringan residu untuk aliran informasi yang lebih baik.
  • Kimi Model Evolution: Melacak perkembangan dari Kimi K1.5 melalui K2.5 ke K3, menunjukkan bagaimana setiap iterasi menyempurnakan resep pelatihan dan infrastruktur.

Mengikuti jalur ini memberikan konteks yang diperlukan untuk memahami mengapa pilihan arsitektur spesifik dibuat dalam Kimi K3 alih-alih melihatnya sebagai produk mandiri.