Local inference
media Hugging Face Forums · منذ 2 ساعة · مشاهدتان

يوفر vLLM Launcher منصة عمل سطح مكتب لنظام Windows للاستدلال المحلي للنماذج اللغوية الكبيرة

تم إصدار مشروع جديد يُسمى vLLM Launcher كتطبيق سطح مكتب لنظام Windows مصمم لإدارة استدلال النماذج اللغوية الكبيرة محليًا عبر WSL2. يسمح هذا الأداة للمستخدمين بالتحكم في العديد من خلفيات المحركات، بما في ذلك vLLM و SGLang و llama.cpp، من واجهة رسومية واحدة.

github llama.cpp · منذ 16 ساعة · 5 مشاهدات

يضيف llama.cpp b10328 عزل أدوات الخادم الأولي عبر Docker

أصدر مشروع llama.cpp الإصدار b10328، الذي يقدم دعمًا أوليًا لعزل الأدوات داخل مكون الخادم باستخدام Docker. يتضمن هذا التحديث توثيقًا وتكييفات للكود لفصل صناديق رمل I/O للأدوات وإعادة تسمية أعلام التكوين ذات الصلة.

github llama.cpp · منذ 4 يوم · مشاهدة واحدة

يضيف llama.cpp b10282 عدادات spec-decode إلى نقطة النهاية /metrics

أصدر مشروع llama.cpp الإصدار b10282، الذي يقدم قدرات مراقبة جديدة للترميز التخميني. يتضمن الخادم الآن عدادات spec-decode في نقطة النهاية الخاصة به /metrics، مما يسمح للمستخدمين بتتبع مقاييس الأداء المتعلقة بهذه الميزة.

github llama.cpp · منذ 8 يوم · 10 مشاهدات

llama.cpp b10219 يحافظ على reasoning_content في سجل الدردشة

أصدر مشروع llama.cpp الإصدار b10219، والذي يتضمن إصلاحًا لواجهة سطر الأوامر (CLI) للحفاظ على محتوى الاستدلال داخل سجل الدردشة. سابقًا، بينما كان `llama-cli` يجمع الاستدلال من التدفق للعرض، كان يخزن فقط محتوى المساعد في الرسائل، مما منع العلم `--reasoning-preserve` من إعادة حقن الأفكار السابقة في الأدوار اللاحقة.