قام مشروع llama.cpp بتوسيع نواة الضرب العام للمصفوفات (MMA) ذات الأسطر القليلة لدعم أنواع بيانات المصدر الإضافية، بما في ذلك BF16 وQ1_0 وQ2_0 وMXFP4 وQ2_K وQ3_K وTQ2_0 وأنواع IQ المختلفة. يتيح هذا التحديث للنواة المحسّنة التعامل مع أي نوع يحتوي على مزيل تكميم (dequantizer) للأوزان بـ 16 بت، مع تطبيق عتبات عدد أسطر محددة على عتاد M3 Ultra حيث تبدأ الأداء في تجاوز النوى الحالية.
- يغطي الدعم الجديد BF16 وQ1_0 وQ2_0 وMXFP4 وQ2_K وQ3_K وTQ2_0 وأنواع IQ.
- تختلف عتبات الأداء حسب النوع: 5 أسطر لـ TQ2_0، و4 لـ BF16، و3 لـ MXFP4/Q2_0/Q2_K/IQ4_NL، و2 للأنواع الأخرى.
- أظهرت نتائج المعايير على M3 Ultra نسب أداء تتراوح من 0.23 إلى 1.01 اعتمادًا على عدد الأسطر وتداخل النواة.
يحسّن هذا التغيير كفاءة الاستدلال لمجموعة أوسع من تنسيقات التكميم من خلال الاستفادة من قدرات نواة MMA عند أعداد الأسطر المنخفضة.