Moonshot telah merilis bobot model Kimi K3-nya di Hugging Face, dengan 2,8 triliun parameter dan arsitektur mixture-of-experts dengan 16 ahli aktif per token. Tim berencana menempatkan model ini di GPU A100, H200, dan B300, dengan hasil benchmark diharapkan minggu ini.
- Kimi K3 menggunakan pelatihan aware kuantisasi dalam MXFP4, menghasilkan sekitar 1,4 TB bobot.
- Penempatan pada 8x A100 memerlukan tiga node karena kendala memori dan tidak memiliki dukungan FP4 native.
- Konfigurasi 8x H200 juga memerlukan setidaknya dua node, menimbulkan biaya interkoneksi.
- Hanya konfigurasi 8x B300 yang dapat memuat seluruh model dalam satu node dengan ruang untuk KV cache.
Para penulis akan menyediakan metrik token per detik, waktu hingga token pertama, dan biaya untuk ketiga konfigurasi GPU menjelang akhir minggu.