الموضوع · Local inference
github llama.cpp · منذ 3 ساعة · مشاهدة واحدة

دمج llama.cpp b10751 لتقليل خبراء MoE المرجحين لـ CUDA

أصدر مشروع llama.cpp الإصدار b10751، الذي يقدم نواة مدمجة لتقليل الخبراء المرجحين في نموذج MoE (خلطة الخبراء) على CUDA. يحل هذا التحسين محل الأساس السابق الذي كان يشغل نواتين فيزيائيتين بنواة واحدة لتقليل المرجح، مما يقلل من حركة بيانات الذاكرة العالمية الوسيطة.

lab Hugging Face Blog · منذ 8 ساعة · 3 مشاهدات

Hugging Face تطلق 207 نواة WebGPU وأداة لمعايرة المتصفح

أطلقت Hugging Face مكتبة @huggingface/kernels، وهي مكتبة لتحميل وتشغيل نوى WebGPU المحسّنة من Hub الخاص بـ Hugging Face، مع مجموعة أولية تضم 207 نواة. كما يُقدّم هذا الإصدار Fleet، وهو حزمة لمعايرة وحدة المعالجة الرسومية داخل المتصفح تجمع بين أدلة الأداء والدقة من أجهزة المستخدمين.

media r/LocalLLaMA · منذ 17 ساعة · مشاهدة واحدة

ExLlamaV3 يضيف إخراج إلى وحدة المعالجة المركزية للخبراء MoE ونماذج GLM-5.3-Flash و Qwen3.8-Flash الجديدة

أصدرت Turboderp تحديثات كبيرة لـ ExLlamaV3، مقدمةً قدرات إخراج إلى وحدة المعالجة المركزية لخبراء Mixture of Experts (MoE). تتضمن التحديث أيضًا دعمًا للنماذج GLM-5.3-Flash و Qwen3.8-Flash التي تم إصدارها مؤخرًا.

github llama.cpp · منذ 1 يوم · 9 مشاهدات

llama.cpp b10718 يوسع دمج MOE ليشمل specdec والرموز المتعددة

أصدر مشروع llama.cpp الإصدار b10718، والذي يتضمن تحديثًا مهمًا لخلفية CUDA. أبرز تغيير هو توسيع دمج Mixture of Experts (MOE) لدعم الترميز التخميني (specdec)، مما يعالج القيود السابقة حيث كان دمج MOE glu و topk-router مقيدًا بمعالجة رمز واحد فقط في كل مرة.

github llama.cpp · منذ 2 يوم · 11 مشاهدة

llama.cpp b10707 يحسّن مسح خلايا ذاكرة التخزين المؤقت KV لتوليد أسرع

أصدر مشروع llama.cpp الإصدار b10707، الذي يتضمن تحسينًا للأداء في معالجة ذاكرة التخزين المؤقت للقيم الرئيسية (KV). يعدّل التحديث الدالة `for_each_token_in` لإيقاف المسح بمجرد رؤية جميع التسلسلات داخل خلية محددة، بدلاً من التكرار عبر جميع التسلسلات القصوى الممكنة.

github llama.cpp · منذ 3 يوم · 8 مشاهدات

تمكّن llama.cpp من تنفيذ GEMM عبر xmem وتتجاوز tiled f32 على وحدات معالجة الرسومات Adreno

قام مشروع llama.cpp بتحديث الخلفية الخاصة بـ OpenCL لتحسين أداء ضرب المصفوفات على جيلين من وحدات معالجة الرسومات Adreno. تركز التغييرات بشكل أساسي على جيل X2E عن طريق تفعيل مسار GEMM xmem F16xF32 افتراضياً وتحسين التعامل مع جيل A7X.

github llama.cpp · منذ 4 يوم · 10 مشاهدات

يقوم llama.cpp b10670 بتوجيه فك تشفير KV المكمّم إلى TILE على Xe2 (BMG)

أصدر مشروع llama.cpp الإصدار b10670، والذي يتضمن تحسينًا محددًا لهندسة Intel Xe2. يعيد التحديث توجيه عملية فك تشفير المفاتيح والقيم (KV) المكمّمة حصريًا إلى الخلفية الخلفية TILE لأجهزة BMG، مع الحفاظ على الخلفية الخلفية VEC على الهياكل الأخرى حتى يتم التحقق منها.

github llama.cpp · منذ 5 يوم · 7 مشاهدات

إصلاحات llama.cpp b10666 لاختبارات حفظ/تحميل الحالة ونسخ التسلسل على الجهاز

يوسع إصدار llama.cpp b10666 مجموعة اختبارات حفظ/تحميل الحالة لتشغيلها عبر جميع المعماريات ويحل عدة أخطاء حرجة في إدارة الحالة ومعالجة الرسم البياني. تشمل التغييرات الرئيسية إصلاح المراجع العالقة في minimax-01، ومحاذاة نسخ الكتل لتسلسلات الجهاز، وتصحيح أعداد رؤوس المؤشر لـ deepseek4.