إصلاح llama.cpp b11284 لعمليات GET_ROWS في OpenVINO على مشاهد الأوزان المُكمَّاة
أصدر مشروع llama.cpp الإصدار b11284، الذي يتضمن إصلاحًا للخلفية (backend) الخاصة بـ OpenVINO للتعامل بشكل صحيح مع عمليات GET_ROWS على مشاهد الأوزان المُكمَّاة.
أصدر مشروع llama.cpp الإصدار b11284، الذي يتضمن إصلاحًا للخلفية (backend) الخاصة بـ OpenVINO للتعامل بشكل صحيح مع عمليات GET_ROWS على مشاهد الأوزان المُكمَّاة.
أصدر مشروع llama.cpp الإصدار b11280، والذي يتضمن تغييرًا لتقليل مزامنة allreduce للصفوف عن طريق استخدام مخازن مضبوطة على المضيف.
أصدر مشروع llama.cpp الإصدار b11282، الذي يتضمن إصلاحًا لتعريف ماكرو `CUDA_ARCH` لمرور جهاز MUSA. سابقًا، لم يحدد رأس مورد MUSA هذه المتغير، مما تسبب في تقييم اختبارات الهندسة المعمارية في مصادر ggml-cuda المشتركة إلى صفر ونتج عن ذلك أجسام نواة فارغة.
أضاف مشروع llama.cpp الدعم الأولي لهندسة نموذج GLM-5.3-Flash (GLM5-Next)، بما في ذلك الانتقال إلى ذاكرة الفهرس الهجين وقدرات التنبؤ متعدد الرموز (MTP) المبكرة.
أصدر مشروع llama.cpp الإصدار b11273، الذي يُدخل دعم طريقة `classifier_pooling` في نماذج إعادة الترتيب، ويستهدف بشكل خاص معماريات ModernBERT.
أصدر مشروع llama.cpp الإصدار b11272، الذي يتضمن تحسينات للخلفية Hexagon. يركز التغيير الأساسي على تحسين عملية الربط لتحسين الأداء على عتاد Qualcomm Snapdragon.
أصدر مشروع llama.cpp البناء b11266، الذي يتضمن تحسينًا لـ Vulkan يحمّل مصفوفات A من نوع F32 بعنصرين في كل مرة عندما تكون محاذاة بعامل 2. يعالج هذا التغيير مشكلات الأداء على الأجهزة من Intel حيث يكون تحميل الأعداد العائمة واحدًا تلو الآخر غير كفء، كما يصحح نقص التحقق من صحة محاذاة `a_offset` في التصحيح الأصلي.
يتضمن إصدار llama.cpp b11265 إصلاحًا لمعالجة نماذج Mixture of Experts (MoE) بواسطة الخلفية الخلفية Vulkan. يصحّج التحديث كيفية اختيار `mat_mul_id` لبلاطات الضرب المصفوفي، مما يعالج مشكلة أداء كانت تترك فيها العمال في حالة خمول أثناء التوجيه.
أصدر مشروع llama.cpp الإصدار b11260، مقدمًا دعمًا لوظائف التنشيط FP32 GELU_ERF و GEGLU_ERF في الخلفية Hexagon. يتضمن هذا التحديث أيضًا تحسينات لتقليل ضغط المسجلات داخل النوى المرتبطة.
أصدر مشروع llama.cpp الإصدار b11258، الذي يتضمن إصلاحًا لسلوك عامل الخدمة الخاص بواجهة الويب المدمجة. في السابق، كان استخدام الأعلام مثل `--path` أو `--no-ui` يجعل المتصفحات تحتفظ بنسخة مخبأة من الواجهة لأن الخادم يعيد 404 لـ `/sw.js`، وهو ما لا يؤدي إلى إزالة عامل الخدمة.
أصدر مشروع llama.cpp الإصدار b11254، الذي يتضمن إصلاحًا لطريقة جمع موترات المدخلات في الرسم البياني للحساب. سابقًا، كان يتم ملء `graph_inputs` أثناء تقسيم الرسم البياني، مما تسبب في مشاكل مع التوازي عبر الأنابيب حيث أدت التبديلات بين الدفعات التي تستهلك مدخلات مختلفة إلى مقارنات غير صحيحة لمعرّفات الخلفية وإجبار إعادة حجز الجدولة.
يدعم خادم llama.cpp الآن إدخال محتوى مtyped (رؤية، صوت، فيديو) لنقطة النهاية /v1/embeddings. يتيح هذا التحديث طلبات تضمين متعددة الوسائط عن طريق قبول مصفوفات المحتوى المغلفة على طراز OpenAI، مما يسمح بمعالجة أجزاء النص وimage_url معًا.
أصدر مشروع llama.cpp الإصدار b11238، مقدّماً تنفيذًا موحدًا للحشو الأيسر عبر الدالة الجديدة `ggml_pad_ext`. يجمع هذا التغيير الأساليب السابقة المستخدمة في مشفرات الصوت مثل Parakeet وLFM2-Audio وGranite Speech وGemma 4، مما يضمن تطابق التضمينات بتًا ببت لـ Gemma 4 مع تبسيط دعم الخلفية.
أصدر مشروع llama.cpp الإصدار b11232، الذي يتضمن تحديثات لخلفية ggml-cpu. يركز هذا الإصدار على تمكين الانتباه المضيء المربّع لأبعاد الرأس غير المضاعفة للمتجه على بنية x86.
تقدم إصدار llama.cpp b1228 دعمًا للحشو الأيسر والدائري في عملية GGML_OP_PAD للخلفية (backend) الخاصة بـ Metal، مما ينسجم مع تطبيقات CPU و CUDA و Vulkan. يصلح هذا التغيير مشكلات الحشو الأيمن للمصادر المعاد ترتيبها ويضمن سلوكًا متسقًا عبر خلفيات الأجهزة المختلفة.
أصدر مشروع llama.cpp الإصدار b11227، الذي يتضمن تحسينات للأداء تستهدف بشكل خاص التعامل مع العلم `causal_attn` أثناء المعالجة متعددة الوسائط.
يعالج إصدار llama.cpp b11224 نتائج الحساب غير الصحيحة في واجهة Vulkan الخلفية عندما تقرأ عمليات ضرب المصفوفات شرائح من موترات أكبر وذات خطوة، مثل ذاكرات التخزين المؤقت KV.
يسمح خادم llama.cpp الآن بـ RANK pooling batch splitting لمُعيد ترتيب نماذج LLM السببية مثل Qwen3 وQwen3-VL، مما يحل القيود السابقة التي كانت تُفسد إعادة الترتيب للمستندات الطويلة والمتعددة الوسائط.
تطلق نسخة llama.cpp b11216 نوى تحويل والاش-هادامارد السريع (FWHT) في الخلفية SYCL التي تدعم عرض كتل أكبر من 512. سابقاً، كانت العرضات الأكبر تتراجع إلى ضرب مصفوفات كثيف GEMM بتعقيد O(n^2)؛ وتمكّن هذه التغييرات أداءً بسرعة O(n log n) لهذه الأحجام.
أصدر مشروع llama.cpp الإصدار b11214، الذي يتضمن تحديثًا رئيسيًا للخلفية HIP. يُفعّل هذا الإصدار نواة fattn-mma على هياكل CDNA عندما يكون dkq أكبر من 256، ويستهدف بشكل خاص تحسينات الأداء لحجم الدفعات الكبير.