أطلقت مونشوت التفاصيل الكاملة والأوزان والبنية التحتية الداعمة لنموذج Kimi K3، وهو نموذج Mixture-of-Experts بـ 2.8T معامل، مع حوالي 104B معامل نشط لكل توكن. يتضمن الإطلاق تقارير تقنية تفصل عن مكدس السياق الطويل الهجين وأدوات جديدة مثل MoonEP وFlashKDA وAgentEnv.

  • يمتد Kimi K3 عبر الطول والعمق والعرض باستخدام Kimi Delta Attention وGated MLA وsparse LatentMoE، ويُدرَّب عبر تقارب على-policy متعدد المعلمين.
  • تعد مكونات البنية التحتية محورية في الإطلاق، مع دعم النشر من NVIDIA لـ Dynamo وتوفير Red Hat AI لفحوصات FP8-Block Hopper المُضبوطة.
  • يشير تحليل التكلفة إلى متطلبات عتادية كبيرة، حيث تحتاج الحد الأدنى من التكوينات إلى 8x GPUs MI355X وقد يتطلب تقديم الإنتاج 64+ GPU في مجال عالي النطاق الترددي.
  • أدى الإطلاق مفتوح الأوزان إلى تبني سريع من قبل مزودين مثل Perplexity وBaseten وTogether، الذين يقدمون خيارات استنتاج مستضافة بسبب تكلفة الاستضافة الذاتية العالية.

يؤكد الإطلاق أن الأوزان المفتوحة للنماذج المتقدمة تتطلب الآن استثماراً كبيراً في البنية التحتية، مما يحوّل الوصول نحو العروض المستضافة بدلاً من النشر الذاتي البسيط.