يطرح الباحثون SkewAdam، وهو محسّن مصمم لنماذج مزيج الخبراء (MoE)، يخصص أنواعًا مختلفة من الحالة لمجموعات بارامترية مميزة لتقليل استخدام الذاكرة بشكل كبير. ومن خلال تعيين زخم float32 ولحظات ثانية مُعامَلة للعمود الفقري، ولحظات ثانية مُعامَلة للخبراء، ولحظات ثانية دقيقة للموجّه، يقلل SkewAdam حالة المحسّن من 50.6 جيجابايت إلى 1.29 جيجابايت لنموذج ذي 6.78 مليار معلمة.
- ينخفض ذروة ذاكرة التدريب من 81.4 جيجابايت إلى 31.3 جيجابايت، مما يتسع ضمن ميزانية مُسرّع مقدارها 40 جيجابايت.
- يحقق SkewAdam التباسًا للتحقق بقيمة 108.4 على مدى 82 مليون رمز، متفوقًا على AdamW (126.8) وMuon (120.2) وLion (393.7).
- تتحقق وفورات الذاكرة دون فقدان الدقة؛ وينتج تحسّن الأداء عن الاحتفاظ بالزخم وليس عن التخصيص متعدد الطبقات نفسه.
تشير النتائج إلى أن مكان تخصيص حالة المحسّن مهم بقدر حجمه، مما يتيح تدريبًا فعالاً على الأجهزة ذات الذاكرة المحدودة.