أصدر مشروع llama.cpp الإصدار b11403، والذي يتضمن تحسينًا لـ CUDA لاستخدام نواة MMVF لضرب المصفوفات f16 و bf16 الرقيقة بأحجام دفعات صغيرة.
- تم تعديل منطق اختيار النواة لتحسين الأداء على وحدات معالجة الرسومات NVIDIA.
- تم توفير ملفات ثنائية لأنظمة macOS (Apple Silicon و Intel)، و Linux (CPU، Vulkan، CUDA 12/13، ROCm، OpenVINO، SYCL، Snapdragon)، و Windows (CPU، OpenCL، CUDA 12/13، Vulkan، OpenVINO، SYCL، ROCm)، و Android، و openEuler.
- تم تضمين XCFramework الخاص بـ iOS وبناء واجهة المستخدم إلى جانب الملفات الثنائية القياسية.