أصدر مشروع llama.cpp الإصدار b10726، الذي يقدم تحسينات أداء كبيرة لمعالجة أحجام الدُفعات الكبيرة في النماذج المُكمَّاة بـ IQ. يستفيد التحديث الأساسي من تعليمات AVX2 لتسريع تكميات IQ الشبكية عبر عمليات GEMM بالدُفعات.

  • تنفيذ GEMM بالدُفعات لتكميات IQ الشبكية
  • متجهية فك تشفير لوحات IQ مع خفض العتبة للتسريع
  • إدخال نواة ggml_gemm_iqp_8x8_q8_K_p4 وإزالة مخزن gather
  • تخطيط gather بمصدر واحد، وتحيز البوابة، والتداخل المتجهي للوحات IQ
  • إضافة دعم التراجع NUMA واختبارات الدُفعات المكونة من 10 صفوف لتغطية IQP

يوفر هذا الإصدار قدرات استنتاج أسرع للمستخدمين الذين يشغلون نماذج IQ على الأجهزة المتوافقة.