المصدر · llama.cpp
github llama.cpp · منذ 9 ساعة · مشاهدة واحدة

يحدد llama.cpp b11282 CUDA_ARCH لمرور جهاز MUSA

أصدر مشروع llama.cpp الإصدار b11282، الذي يتضمن إصلاحًا لتعريف ماكرو `CUDA_ARCH` لمرور جهاز MUSA. سابقًا، لم يحدد رأس مورد MUSA هذه المتغير، مما تسبب في تقييم اختبارات الهندسة المعمارية في مصادر ggml-cuda المشتركة إلى صفر ونتج عن ذلك أجسام نواة فارغة.

github llama.cpp · منذ 19 ساعة · مشاهدتان

يحمّل llama.cpp الإصدار b11266 مصفوفة A من نوع F32 بعنصرين في كل مرة لـ Vulkan على معالجات Intel

أصدر مشروع llama.cpp البناء b11266، الذي يتضمن تحسينًا لـ Vulkan يحمّل مصفوفات A من نوع F32 بعنصرين في كل مرة عندما تكون محاذاة بعامل 2. يعالج هذا التغيير مشكلات الأداء على الأجهزة من Intel حيث يكون تحميل الأعداد العائمة واحدًا تلو الآخر غير كفء، كما يصحح نقص التحقق من صحة محاذاة `a_offset` في التصحيح الأصلي.

github llama.cpp · منذ 21 ساعة · مشاهدة واحدة

إصلاح llama.cpp b11265 لاختيار بلاطات matmul MOE في Vulkan

يتضمن إصدار llama.cpp b11265 إصلاحًا لمعالجة نماذج Mixture of Experts (MoE) بواسطة الخلفية الخلفية Vulkan. يصحّج التحديث كيفية اختيار `mat_mul_id` لبلاطات الضرب المصفوفي، مما يعالج مشكلة أداء كانت تترك فيها العمال في حالة خمول أثناء التوجيه.

github llama.cpp · منذ 1 يوم · مشاهدة واحدة

llama.cpp b11258 يزيل عامل الخدمة المدمج لواجهة المستخدم عندما لا يتم تقديم واجهة المستخدم

أصدر مشروع llama.cpp الإصدار b11258، الذي يتضمن إصلاحًا لسلوك عامل الخدمة الخاص بواجهة الويب المدمجة. في السابق، كان استخدام الأعلام مثل `--path` أو `--no-ui` يجعل المتصفحات تحتفظ بنسخة مخبأة من الواجهة لأن الخادم يعيد 404 لـ `/sw.js`، وهو ما لا يؤدي إلى إزالة عامل الخدمة.

github llama.cpp · منذ 1 يوم · 7 مشاهدات

إصلاح llama.cpp b11254 لجمع مدخلات الرسم البياني للتوازي عبر الأنابيب

أصدر مشروع llama.cpp الإصدار b11254، الذي يتضمن إصلاحًا لطريقة جمع موترات المدخلات في الرسم البياني للحساب. سابقًا، كان يتم ملء `graph_inputs` أثناء تقسيم الرسم البياني، مما تسبب في مشاكل مع التوازي عبر الأنابيب حيث أدت التبديلات بين الدفعات التي تستهلك مدخلات مختلفة إلى مقارنات غير صحيحة لمعرّفات الخلفية وإجبار إعادة حجز الجدولة.

github llama.cpp · منذ 2 يوم · 3 مشاهدات

يضيف llama.cpp b11240 دعم الإدخال متعدد الوسائط المtyped إلى /v1/embeddings

يدعم خادم llama.cpp الآن إدخال محتوى مtyped (رؤية، صوت، فيديو) لنقطة النهاية /v1/embeddings. يتيح هذا التحديث طلبات تضمين متعددة الوسائط عن طريق قبول مصفوفات المحتوى المغلفة على طراز OpenAI، مما يسمح بمعالجة أجزاء النص وimage_url معًا.

github llama.cpp · منذ 2 يوم · 4 مشاهدات

يضيف llama.cpp b11238 ggml_pad_ext للحشو الأيسر ويتخطى نقرات DFlash2

أصدر مشروع llama.cpp الإصدار b11238، مقدّماً تنفيذًا موحدًا للحشو الأيسر عبر الدالة الجديدة `ggml_pad_ext`. يجمع هذا التغيير الأساليب السابقة المستخدمة في مشفرات الصوت مثل Parakeet وLFM2-Audio وGranite Speech وGemma 4، مما يضمن تطابق التضمينات بتًا ببت لـ Gemma 4 مع تبسيط دعم الخلفية.

github llama.cpp · منذ 2 يوم · 3 مشاهدات

يضيف llama.cpp b11228 دعم الحشو الأيسر والدائري في GGML_OP_PAD الخاص بـ Metal

تقدم إصدار llama.cpp b1228 دعمًا للحشو الأيسر والدائري في عملية GGML_OP_PAD للخلفية (backend) الخاصة بـ Metal، مما ينسجم مع تطبيقات CPU و CUDA و Vulkan. يصلح هذا التغيير مشكلات الحشو الأيمن للمصادر المعاد ترتيبها ويضمن سلوكًا متسقًا عبر خلفيات الأجهزة المختلفة.

github llama.cpp · منذ 3 يوم · 3 مشاهدات

إصلاح llama.cpp b11224 لنتائج mul_mat الخاطئة في Vulkan على مشاهد ذاكرة التخزين المؤقت KV ذات الخطوة

يعالج إصدار llama.cpp b11224 نتائج الحساب غير الصحيحة في واجهة Vulkan الخلفية عندما تقرأ عمليات ضرب المصفوفات شرائح من موترات أكبر وذات خطوة، مثل ذاكرات التخزين المؤقت KV.

github llama.cpp · منذ 3 يوم · 13 مشاهدة

يضيف llama.cpp b11216 نوى FWHT لـ SYCL لعرض كتل يتجاوز 512

تطلق نسخة llama.cpp b11216 نوى تحويل والاش-هادامارد السريع (FWHT) في الخلفية SYCL التي تدعم عرض كتل أكبر من 512. سابقاً، كانت العرضات الأكبر تتراجع إلى ضرب مصفوفات كثيف GEMM بتعقيد O(n^2)؛ وتمكّن هذه التغييرات أداءً بسرعة O(n log n) لهذه الأحجام.