يصلح llama.cpp b10435 التكلفة التربيعية في jinja gather_string_parts
أصدر مشروع llama.cpp الإصدار b10435، الذي يعالج مشكلة أداء داخل محرك القوالب Jinja. يتضمن التغيير الرئيسي إصلاح خطأ تعقيد زمني تربيعي في دالة `gather_string_parts`.
أصدر مشروع llama.cpp الإصدار b10435، الذي يعالج مشكلة أداء داخل محرك القوالب Jinja. يتضمن التغيير الرئيسي إصلاح خطأ تعقيد زمني تربيعي في دالة `gather_string_parts`.
أصدر مشروع llama.cpp الإصدار b10434، الذي يضيف دعمًا لتمرير معلمة `reasoning_effort` إلى قوالب Jinja. يضمن هذا التغيير تخزين قيم `reasoning_effort` من OpenAI Chat Completions وجعلها متاحة أثناء التوليد.
أصدر مشروع llama.cpp الإصدار b10431، الذي يقدم دعمًا لتراجع الحالة المتكررة (RS) في عملية ggml_ssm_scan. يتيح هذا التغيير تراجع RS لنماذج Nemotron على خلفيات CPU و CUDA.
أصدر مشروع llama.cpp الإصدار b10429، الذي يعدل الخادم للسماح بالوصول إلى نقاط النهاية /metrics و /slots أثناء تنفيذ llama_decode().
أصدر مشروع llama.cpp الإصدار b10430، الذي يقدم دعمًا لأجهزة GPU المتكاملة (igpu) الافتراضية. يتضمن هذا التحديث أيضًا تعليقات محسّنة داخل قاعدة الشفرة.
أصدر مشروع llama.cpp الإصدار b10427، الذي يتضمن تحسينًا للأداء لوحات Intel Arc الرسومية عبر SYCL. يطبق التحديث دمج عمليات gate و up و GLU داخل طبقة الشبكة العصبية الأمامية الكثيفة (FFN) من نوع q4_K.
أصدر مشروع llama.cpp الإصدار b10425، والذي يتضمن منفذًا لتحسين SYCL لدمج نسخة كتابة حالة gated-delta-net للخلف.
أصدر مشروع llama.cpp الإصدار b10418، مقدمًا دعمًا لذاكرة المضيف المثبتة لتحسين وصول المضيف إلى الجهاز في SYCL. يعالج هذا التحديث مشكلات أمان الخيوط داخل تنفيذ الخلفية.
قام مشروع llama.cpp بدمج تحديثات كبيرة لخلفيته OpenVINO، تركز بشكل أساسي على تمكين دعم عائلة نماذج Qwen3.5 وإدخال عدة تقنيات لتحسين استهلاك الذاكرة.
أصدر مشروع llama.cpp الإصدار b10416، معالجاً مشكلة تخزين مؤقت على موقع llama.app حيث كان ملف index.html مثبتاً على الإصدارات القديمة بسبب رؤوس غير قابلة للتغيير.
أصدر مشروع llama.cpp الإصدار b10413، الذي يُدخل الكشف التلقائي عن نوع مواصفات فك التشفير التخميني مباشرةً من بيانات نموذج GGUF الخاصة بالمسودة.
أصدر مشروع llama.cpp الإصدار b10414، مقدمًا دعمًا لنوع الكمي الثلاثي GGML_TYPE_TQ2_0 في الخلفية Metal. يتضمن هذا التحديث أيضًا تحسينات لنواة mul_mv للصفائف المتصلة (cont).
أصدر مشروع llama.cpp الإصدار b10412، الذي يقدم دعمًا لأخذ العينات الخلفية لكل من الخلفيات dflash و dspark. يتيح هذا التحديث أيضًا قيم p_min الأكبر من 0 ضمن منطق أخذ العينات الخلفية ويضيف الحماية المناسبة.
أصدر مشروع llama.cpp الإصدار b10410، والذي يتضمن تغييرًا في الكود لخلفية SYCL. يزيل هذا التحديث الترقية المنفصلة لنوع fp32 في مسار GEMM غير oneDNN ويستخدم بدلاً من ذلك الترقية التلقائية لـ fp16.
أصدر مشروع llama.cpp الإصدار b10408، الذي يقدم نواة DMMV Q3_K ESIMd لبطاقات Intel الرسومية. يتضمن هذا الإصدار أيضًا نوادر ESIMD الجديدة Q4_K وQ6_K ويعيد هيكلة قاعدة الكود للسماح بالتحكم في ESIMD في وقت التشغيل بدلاً من وقت الترجمة.
أصدر مشروع llama.cpp الإصدار b10369، مقدمًا دعمًا لنموذج تحويل النص إلى كلام pocket-tts. يتضمن هذا التحديث تنفيذًا جديدًا للتلافيف المعكوسة باستخدام GEMM وcol2im لتحسين الأداء.
يعالج إصدار llama.cpp b10361 خطأً حرجاً حيث لم يكن الانتباه ذو النافذة المنزلقة (SWA) مفعّلاً لنموذج LGAI-EXAONE 4.5 بسبب ترتيب المعلمات غير الصحيح أثناء التحميل.
أصدر مشروع llama.cpp الإصدار b10356، الذي يستهدف بشكل أساسي بنية البناء من خلال تحويل الخلفية ROCm من الإصدار 7.2.1 إلى 7.14. يتوافق هذا التحديث مع كون ROCm 7.14 هو أول إصدار إنتاجي يستخدم نظام البناء TheRock ويتضمن ترحيل مهام CI لاستخدام عجلات متعددة البنى لكل من لينكس وويندوز.
أصدر مشروع llama.cpp الإصدار b10355، مدعومًا بدعم لأخذ العينات للخلفية متعددة المخرجات. يتيح هذا التحديث الجمع بين أخذ العينات للخلفية وتخمين الرموز ويضيف معلمة سياق رقمية للإعلان عن الحد الأقصى للمخرجات لكل تسلسل.
أصدر مشروع llama.cpp الإصدار b10353، الذي يعالج خطأً حرجًا في عملية ggml_roll على خلفيات CUDA و Metal. سابقًا، كانت موترات المصدر المُبدَّلة (غير المتصلة) تنتج نتائج خاطئة بصمت لأن هذه الخلفيات تتجاهل معلومات الخطوة.