يجذب نموذج G9v3-39A5B الانتباه لأدائه على artificialanalysis، حيث يُذكر أنه يتصدر تصنيف Qwen 3.6 27B.
- إنه بنية Mixture of Experts (MoE).
- يوجد فرع ميزات لـ llama.cpp لدعم تنسيق G9v3.
- نقاط التفتيش GGUF متاحة عبر Hugging Face.
يجذب نموذج G9v3-39A5B الانتباه لأدائه على artificialanalysis، حيث يُذكر أنه يتصدر تصنيف Qwen 3.6 27B.
يُظهر تشخيص باستخدام خط أنابيب الاستدعاء المحايد للأجهزة من Celestium أن Stable Diffusion XL يمكنه العمل بشكل مستقر على وحدات معالجة الرسومات ذات الذاكرة المنخفضة (4GB، 6GB، و8GB) من خلال الاستفادة من الدقة التكيفية FP16 وتنظيف الذاكرة المستقل. تمنع هذه الطريقة ارتفاعات التجزئة أثناء خطوط الأنابيب متعددة المراحل وتستخدم وضع الطوارئ لوحدة المعالجة المركزية للحفاظ على التوليد عند استنفاد ذاكرة وحدة معالجة الرسومات.
أصدر مشروع llama.cpp الإصدار b10505، الذي يقدم خيار preset جديدًا `dedup-cache-models` لمكون الخادم.
يُظهر ntrillard أن تكميم طيف السعة (magnitude) للقيم في ذاكرة التخزين المؤقت لـ K و V إلى 4 بت مع الحفاظ على الطور بدقة كاملة يحقق تطابقاً بنسبة 96.9% للرموز مقارنةً بالإشارة المرجعية fp16 على نموذج Gemma-3-1B، مما يمثل تحسناً بنسبة 5-10 أضعاف مقارنة بالتكميم القياسي بأقصى وأدنى قيمة.
أضاف مشروع llama.cpp الدعم لنموذج النصوص Kimi-K3، بتنفيذ بنية الانتباه الهجينة الخاصة به (KDA الخطي + MLA الكامل) إلى جانب خمسة ميزات معمارية محددة غير موجودة في النسخة الأقدم Kimi-Linear-48B.
أصدر مشروع llama.cpp الإصدار b10447، والذي يتضمن إعادة تصميم لنموذج الخيوط `yield_to_queue`. تتضمن هذه التغييرات تشغيل `common_speculative_process` في العامل وتبديل تصميم الخيط العامل إلى الرئيسي.
نستخدم ملفات تعريف الارتباط لقياس الزيارات وتحسين الموقع. يمكنك قبول أو رفض ملفات تعريف الارتباط الخاصة بالتحليلات. سياسة الخصوصية