أصدر مشروع llama.cpp الإصدار b10907، والذي يتضمن إصلاحًا لتخصيص ذاكرة التخزين المؤقت للمفتاح والقيمة للسياق في التنبؤ متعدد الرموز (MTP). يعالج هذا التحديث المشكلات التي تؤثر على هياكل deepseek2 و glm4moe و cohere2moe.
- يصلح تخصيص ذاكرة التخزين المؤقت kv للسياق MTP لنماذج deepseek2 و glm4moe و cohere2moe.
- يضيف بوابات هيكلية عكسية واختبارات شاملة للهياكل لفلترة طبقات MTP.
- يقلل من تعليق مرشح NextN ويلغي تغييرات test-llama-archs.
يوفر الإصدار ملفات ثنائية لأنظمة macOS (Apple Silicon و Intel) و iOS و Linux (CPU و Vulkan و ROCm و OpenVINO و SYCL) و Android و Windows (CPU و CUDA و OpenCL و Vulkan و OpenVINO و SYCL و ROCm) و openEuler.