أصدر مشروع llama.cpp الإصدار b10532، مقدماً مرحلة معالجة مسبقة على الخلفية البرمجية لـ Metal تقوم بفك تكميم مخازن الذاكرة الرئيسية والقيمة (KV) المكمّمة إلى صيغة F16 قبل تنفيذ خوارزمية الانتباه السريع.
- يقوم النواة الجديدة بفك تكميم موترات KV من نوع Q8_0 وتخزينها في مخزن مؤقت متواصل بصيغة F16، مما يتيح استخدام نوى الانتباه السريع القائمة على F16 بدلاً من فك التكميم داخل النواة.
- تم توسيع الدعم ليشمل جميع أنواع KV المكمّمة المدعومة بواسطة Metal، بما في ذلك Q4_0 وQ4_1 وQ5_0 وQ5_1.
- بالنسبة للنماذج القائمة على MLA حيث يمثل V عرضاً لـ K، يتخطى التنفيذ فك تكميم V غير الضروري ويقرأ V من مخزن F16 الخاص بـ K.
- أظهر التحقق على جهاز M2 Ultra أن التشتت (perplexity) للنموذج Qwen2.5-0.5B مع KV بصيغة q8_0 يطابق المرجع بصيغة F16 تماماً (PPL 1.0008).
يُمكّن هذا التغيير تنفيذ الانتباه السريع بكفاءة على أجهزة Metal من خلال الاستفادة من المخازن المتصلة بصيغة F16 لمخازن KV المكمّمة، مما يضمن دقة مطابقة لتنفيذات F16 القياسية.