أطلقت Apple بنية جديدة لنماذجها الأساسية من الجيل الثالث (AFM3) تستخدم "تقليم اتباع التعليمات" لتقليل عدد المعاملات النشطة بشكل كبير. تم تصميم النموذج لتفعيل حوالي 20% من طبقات MLP الخاصة به عن طريق اتخاذ قرارات التوجيه مرة واحدة لكل طلب بدلاً من كل توكن.
- يحتفظ النظام بالنموذج بأكمله في التخزين الفلاشي ويحمّل فقط مجموعة صغيرة من معاملات "الخبراء" (بين 1 و4 مليار) إلى ذاكرة العمل في أي وقت.
- يبقى قلب الخبراء المشتركين نشطًا دائمًا، بينما يتم تحميل باقي المعاملات عند الطلب بناءً على طلب الإدخال.
- يسمح هذا النهج لـ MoE النشط بحجم 30B بتحقيق أداء عرض نطاق قراءة قابل للمقارنة مع نموذج نشط بحجم 14B، ويحول فعليًا نموذجًا كثيفًا بحجم 9B إلى نموذج نشط بحجم 3B.
تهدف هذه الطريقة إلى تحسين الكفاءة من خلال تقليل استخدام الذاكرة مع الحفاظ على الأداء من خلال أنماط تفعيل متفرقة.