أضاف مكون webgpu الدعم لتنسيقات MMVQ (Multi-Mode Vector Quantization)، وتحديداً Q1_0 و Q5_0 و Q5_1 و Q3_K و Q5_K و Q6_K و MXFP4.
يعالج هذا التحديث المشكلة #29 في مستودع llama.cpp لتوسيع قدرات الكمّية داخل بيئة webgpu.
أضاف مكون webgpu الدعم لتنسيقات MMVQ (Multi-Mode Vector Quantization)، وتحديداً Q1_0 و Q5_0 و Q5_1 و Q3_K و Q5_K و Q6_K و MXFP4.
يعالج هذا التحديث المشكلة #29 في مستودع llama.cpp لتوسيع قدرات الكمّية داخل بيئة webgpu.
قام المؤلف ببناء eqx-zoo، وهي مكتبة تحمّل نقاط التفتيش من Hugging Face Hub مباشرةً كوحدات عادية من Equinox وتتحقق من كل نموذج مقابل مكتبة transformers. يدعم المشروع حاليًا Llama و Qwen2 و Qwen3 و Qwen3-MoE للتوليد، و BERT و RoBERTa و XLM-RoBERTa للتضمينات.
أصدر المؤلف AiiStream Q3.6، وهي تقنية مفتوحة المصدر تتيح تشغيل نموذج Qwen3.6-35B-A3B على أجهزة Apple Silicon بذاكرة وصول عشوائي تتراوح بين 8 إلى 16 جيجابايت فقط. من خلال الحفاظ على الخبراء الموجهين على وحدة تخزين الحالة الصلبة (SSD) واستخدام تنبؤات التحميل المبكر، تقلل الطريقة استخدام ذاكرة MLX إلى حوالي 1.7 جيجابايت مع الحفاظ على مخرجات مطابقة تماماً على مستوى البايت مقارنةً بالتنفيذ القياسي لـ mlx_lm.
أصدر مشروع llama.cpp الإصدار b11307، الذي يصلح ترتيب إدخال الطبقات للحفاظ على تسلسل الدفعة الأصلي أثناء الترميز التنبؤي. يضمن هذا التغيير الحفاظ على ترتيب الرموز بشكل صحيح للتضمينات غير المقنعة NextN والتوافق مع تقسيمات الأوتار.
أصدر مشروع llama.cpp الإصدار b11301، والذي يتضمن إصلاحًا لمشكلة تجاوز السليم داخل مكونات ggml و gguf. يعالج هذا التحديث منطق التحقق لمنع الأخطاء المحتملة عند التعامل مع موترات ذات صفر عنصر.
أصدر مشروع llama.cpp الإصدار b11302، الذي يعالج مشكلة توافق حرجة تم تحديدها بواسطة ThreadSanitizer في خط أنابيب الاختبار المستمر (CI). يحل التحديث سباق بيانات داخل آلية الانتباه المتناثر حيث كانت خيوط المعالج المركزي متعددة تكتب بشكل غير صحيح في نفس عناصر الذاكرة.
نستخدم ملفات تعريف الارتباط لقياس الزيارات وتحسين الموقع. يمكنك قبول أو رفض ملفات تعريف الارتباط الخاصة بالتحليلات. سياسة الخصوصية