Inference efficiency
media Hugging Face Forums · منذ 2 ساعة · مشاهدتان

يوفر vLLM Launcher منصة عمل سطح مكتب لنظام Windows للاستدلال المحلي للنماذج اللغوية الكبيرة

تم إصدار مشروع جديد يُسمى vLLM Launcher كتطبيق سطح مكتب لنظام Windows مصمم لإدارة استدلال النماذج اللغوية الكبيرة محليًا عبر WSL2. يسمح هذا الأداة للمستخدمين بالتحكم في العديد من خلفيات المحركات، بما في ذلك vLLM و SGLang و llama.cpp، من واجهة رسومية واحدة.

github llama.cpp · منذ 9 ساعة · 4 مشاهدات

يصلح llama.cpp b10331 get_info للخادم للإبلاغ عن دليل العمل المعزول الصحيح

أصدر مشروع llama.cpp الإصدار b10331، والذي يتضمن إصلاحًا لنقطة النهاية `get_info` للخادم. سابقًا، عندما لم يتم توفير دليل عمل حالي صريح، كانت الوظيفة تعود بشكل غير صحيح إلى دليل عمل عملية الخادم، حتى إذا كان tools runtime مُعدًا.

github llama.cpp · منذ 16 ساعة · 5 مشاهدات

يضيف llama.cpp b10328 عزل أدوات الخادم الأولي عبر Docker

أصدر مشروع llama.cpp الإصدار b10328، الذي يقدم دعمًا أوليًا لعزل الأدوات داخل مكون الخادم باستخدام Docker. يتضمن هذا التحديث توثيقًا وتكييفات للكود لفصل صناديق رمل I/O للأدوات وإعادة تسمية أعلام التكوين ذات الصلة.

github llama.cpp · منذ 2 يوم

إصلاحات llama.cpp b10321 لعمليات NORM/RMS_NORM لأطوال الصفوف الجزئية في simdgroup

أصدر مشروع llama.cpp الإصدار b10321، الذي يتضمن إصلاحًا حاسمًا لعمليتي GGML_OP_NORM وGGML_OP_RMS_NORM على Metal. يحل التحديث مشكلة كانت تؤدي فيها مجموعات الخيوط ذات الأحجام التي تترك مجموعة SIMD جزئية إلى حسابات غير صحيحة للوسيط والتباين بسبب فقدان المجاميع الجزئية.

github llama.cpp · منذ 2 يوم · مشاهدة واحدة

يضيف llama.cpp b10306 مسارًا مسطحًا لـ SYCL GLU ويوحّد النوى

تُقدّم إصدار llama.cpp b10306 تحسينات في الأداء للخلفية SYCL، مستهدفةً على وجه التحديد عمليات وحدة الخطية المقننة (GLU). يضيف التحديث مسارًا سريعًا متواصلًا لعمليات GLU المدمجة ويوحّد النوى المختلفة سابقًا لمشاركة مُطلق مشترك.

github llama.cpp · منذ 3 يوم · مشاهدة واحدة

يصلح llama.cpp b10291 دفعات إرسال Vulkan ويضيف أدوات تصحيح أخطاء DeviceLost

أصدر مشروع llama.cpp الإصدار b10291، والذي يتضمن إصلاحات حرجة للخلفية (backend) الخاصة بـ Vulkan إلى جانب تحديثات المنصة القياسية. تعالج التغييرات التقنية الرئيسية مشاكل حجم دفعات الإرسال وتقدم قدرات تشخيصية جديدة لأخطاء السائق.

github llama.cpp · منذ 3 يوم

يضيف llama.cpp b10290 دالة ggml_build_forward_order لإصلاح تنفيذ رسم بياني للصوت

أصدر مشروع llama.cpp الإصدار b10290، مقدمًا دالة جديدة `ggml_build_forward_order` إلى مكتبة ggml. يعالج هذا التغيير خطأً في الرسم البياني للصوت mtmd حيث كان استخدام `ggml_build_forward_expand` كمؤشر ترتيب نقي يؤدي إلى تنفيذ الفروع غير المحددة بإدخالات قديمة.

media Hugging Face Forums · منذ 3 يوم · مشاهدة واحدة

QuantCheck تحذر من افتراض أن نقطة التفتيش النهائية هي الأفضل للتكميم رباعي البتات

يُبرز أداة جديدة تُسمى QuantCheck أن نقطة التفتيش النهائية للتدريب المسبق قد لا تكون الخيار الأمثل للتكميم رباعي البتات، حيث يمكن أن تظل مقاييس الأداء ثابتة بينما تزداد الهشاشة. لاحظ المؤلف هذا النمط على Pythia-160m، حيث تعرضت نقطة التفتيش النهائية لضرر في الجودة يقارب أربعة أضعار مقارنة بنقطة تفتيش سابقة بنفس الجودة.