أصدر مشروع llama.cpp الإصدار b10241، الذي يعالج خطأً حرجًا في الخلفية (backend) الخاصة بـ CUDA. يحل التحديث سباقات البيانات التي حدثت عند إعادة استخدام الذاكرة المشتركة (SMEM) أثناء اختزال الكتلة.
- إصلاح نقص المزامنة بعد القراءة من SMEM في block_reduce لمنع سباقات البيانات.
- تنفيذ التخزين المؤقت المزدوج لعمليات softmax والتطبيع ذات الصف الواحد.
- إضافة تعليقات توضيحية وحواجز ذاكرة مخصصة لسيناريوهات multi-warp.
- توفير ملفات قابلة للتنفيذ لأنظمة macOS وLinux وWindows وAndroid وiOS عبر CPU وCUDA وVulkan وROCm والخلفيات الأخرى.