أصدر مشروع llama.cpp الإصدار b10201، والذي يتضمن تحسينًا رئيسيًا لخلفية ggml-webgpu. يعزز هذا التحديث أداء flash attention عند التعامل مع ذاكرة التخزين المؤقت للمفتاح والقيمة المُكمّمة أثناء توليد السياق الطويل.
- معالجة متجهية محسّنة لـ flash attention لـ KV المُكمّم في ggml-webgpu.
- إصلاح الأخطاء المتعلقة بفحص نوع القيمة وتحديث التعليقات.
- حل أخطاء البناء الناتجة عن إعادة الأساس (rebasing).
- توفير ملفات ثنائية لأنظمة macOS (Apple Silicon, Intel)، وLinux (CPU، Vulkan، ROCm، OpenVINO، SYCL)، وAndroid، وWindows (CPU، CUDA 12/13، Vulkan، OpenCL، HIP، OpenVINO، SYCL)، وopenEuler.
يتيح هذا الإصدار للمستخدمين تشغيل llama.cpp عبر مجموعة واسعة من المنصات الأجهزة مع الاستفادة من آليات الانتباه المُحسّنة للسلاسل الأطول.