أصدر مشروع llama.cpp الإصدار b10835، والذي يتضمن إصلاحًا لمشكلة الحاجز المتشعب داخل تنفيذ ggml-cuda لـ f16 flash attention. يعالج هذا التحديث أيضًا إعداد مؤشر البيانات الوصفية المكرر في نفس الوحدة.

  • يصلح الحاجز المتشعب في ggml-cuda لـ f16 flash attention (PR #27870).
  • يمنع إعداد مؤشر البيانات الوصفية المكرر في ggml-cuda.

يوفر هذا الإصدار ملفات ثنائية محدثة لأنظمة macOS و Linux و Windows و Android و openEuler عبر خلفيات معالجة مختلفة بما في ذلك CUDA و Vulkan و ROCm و SYCL.