أصدر مشروع llama.cpp الإصدار b10241، الذي يعالج خطأً حرجًا في الخلفية (backend) الخاصة بـ CUDA. يحل التحديث سباقات البيانات التي حدثت عند إعادة استخدام الذاكرة المشتركة (SMEM) أثناء اختزال الكتلة.

  • إصلاح نقص المزامنة بعد القراءة من SMEM في block_reduce لمنع سباقات البيانات.
  • تنفيذ التخزين المؤقت المزدوج لعمليات softmax والتطبيع ذات الصف الواحد.
  • إضافة تعليقات توضيحية وحواجز ذاكرة مخصصة لسيناريوهات multi-warp.
  • توفير ملفات قابلة للتنفيذ لأنظمة macOS وLinux وWindows وAndroid وiOS عبر CPU وCUDA وVulkan وROCm والخلفيات الأخرى.