أصدر مشروع llama.cpp الإصدار b11403، والذي يتضمن تحسينًا لـ CUDA لاستخدام نواة MMVF لضرب المصفوفات f16 و bf16 الرقيقة بأحجام دفعات صغيرة.

  • تم تعديل منطق اختيار النواة لتحسين الأداء على وحدات معالجة الرسومات NVIDIA.
  • تم توفير ملفات ثنائية لأنظمة macOS (Apple Silicon و Intel)، و Linux (CPU، Vulkan، CUDA 12/13، ROCm، OpenVINO، SYCL، Snapdragon)، و Windows (CPU، OpenCL، CUDA 12/13، Vulkan، OpenVINO، SYCL، ROCm)، و Android، و openEuler.
  • تم تضمين XCFramework الخاص بـ iOS وبناء واجهة المستخدم إلى جانب الملفات الثنائية القياسية.