أصدر مشروع llama.cpp الإصدار b10835، والذي يتضمن إصلاحًا لمشكلة الحاجز المتشعب داخل تنفيذ ggml-cuda لـ f16 flash attention. يعالج هذا التحديث أيضًا إعداد مؤشر البيانات الوصفية المكرر في نفس الوحدة.
- يصلح الحاجز المتشعب في ggml-cuda لـ f16 flash attention (PR #27870).
- يمنع إعداد مؤشر البيانات الوصفية المكرر في ggml-cuda.
يوفر هذا الإصدار ملفات ثنائية محدثة لأنظمة macOS و Linux و Windows و Android و openEuler عبر خلفيات معالجة مختلفة بما في ذلك CUDA و Vulkan و ROCm و SYCL.