أطلقت Moonshot أوزان نموذج Kimi K3 الخاص بها على Hugging Face، بـ 2.8 تريليون معلمة وهندسة mixture-of-experts مع 16 خبير نشط لكل توكن. تخطط الفريق لنشر النموذج عبر وحدات GPU من نوع A100 و H200 و B300، مع توقع نتائج الاختبارات المرجعية هذا الأسبوع.
- يستخدم Kimi K3 التدريب الواعي بالكمية في MXFP4، مما يؤدي إلى حوالي 1.4 تيرابايت من الأوزان.
- يتطلب النشر على 8x A100 ثلاثة عقد بسبب قيود الذاكرة ويفتقر إلى دعم FP4 الأصلي.
- تتطلب إعدادات 8x H200 أيضًا عقدين على الأقل، مما يتسبب في تكاليف الربط البيني.
- فقط تكوين 8x B300 يتسع للنموذج بأكمله في عقد واحد مع مساحة لـ KV cache.
سيقدم المؤلفون مقاييس التوكنات في الثانية، والوقت حتى أول توكن، ومقاييس التكلفة لجميع تكوينات GPU الثلاثة بحلول نهاية الأسبوع.