يوسع إصدار llama.cpp b10089 عمليات CUDA GET_ROWS لدعم تنسيقات الكمية k-quants و i-quants و mxfp4. يضمن هذا التغيير أن جميع أنواع GGML المكمّاة يمكنها الآن استخدام المسار المباشر للجهاز لعمليات البحث عن التضمين.

  • يضيف دعم k-quant (من q2_K إلى q6_K) للتعامل مع وصفات GGUF الشائعة مثل Q4_K_M.
  • يوسع مُزيلّي الكمية المشتركين للنطاق الفائق إلى تسعة i-quants بترتيب 32 خيطًا.
  • ينقل مُزيل كمية mxfp4 إلى المساعدين المشتركين، مما يغطي تغطية أنواع GET_ROWS على CUDA.
  • يُقيّد فحوصات حجم الصف لأنواع النطاق الفرعي ذات الـ 32 قيمة فقط (iq4_nl و mxfp4) لمنع التراجع غير الضروري إلى المضيف.

من خلال منع الجدول من التراجع إلى المضيف لهذه الأنواع الكمية، يتجنب التحديث نسخ مصفوفة التضمين الكاملة مرة أخرى في كل رمز في الرسوم البيانية لجهاز واحد.