تحدد هذه المقالة تسلسلاً محدداً من أوراق البحث وتقارير النماذج لمساعدة القراء على فهم التطور التقني وراء نموذج Moonshot AI Kimi K3. وتجادل بأن K3 ليس إصداراً منعزلاً، بل هو تقاطع لعدة مسارات بحثية متميزة، بما في ذلك آليات الانتباه الخطي وتصاميم Mixture-of-Experts المتفرقة.

  • Linear Transformers Are Secretly Fast Weight Programmers: تأسس الأساس من خلال تفسير الانتباه الخطي كنظام يحدث الذاكرة الارتباطية.
  • Gated DeltaNet (arXiv:2412.06464): يقدم تحديثات دلتا مقيدة لتحسين إدارة الحالة عبر التسلسلات الطويلة.
  • Kimi Linear / Kimi Delta Attention (KDA): تقدم البنية الهجينة للانتباه الخطي التي تعمل كعمود فقري لـ K3.
  • LatentMoE and Stable LatentMoE: تفصل صياغة التوجيه في الفضاء الكامن وتطورها، مما يسمح لـ K3 بتنشيط 16 من بين 896 خبيراً موجهاً لكل توكن.
  • Attention Residuals (arXiv:2603.15031): تشرح الآلية التي تسمح للنموذج بقرار كيفية استخدام الشبكات المتبقية لتحسين تدفق المعلومات.
  • Kimi Model Evolution: تتعقب التقدم من Kimi K1.5 مروراً بـ K2.5 وصولاً إلى K3، وتوضح كيف قمت كل تكرار بتحسين وصفات التدريب والبنية التحتية.

يوفر اتباع هذا المسار السياق الضروري لفهم سبب اتخاذ خيارات معمارية محددة في Kimi K3 بدلاً من النظر إليه كمنتج مستقل.