أصدر مشروع llama.cpp الإصدار b10635، والذي يتضمن تحديثات محددة لدعم CUDA. التغيير الرئيسي هو فتح الضرب المصفوفي بدقة مختلطة (mmq) لهندسة Mixture of Experts (MoE) على وحدات معالجة الرسومات ذات القدرة الحسابية 6.0 (sm_60).
- CUDA: تم فتح mmq لـ MoE على sm_60.
- CUDA: تم تكرار mmq-config-pascal لـ dp4a والهندسات الأقدم.
- CUDA: تقليل الإشغال على وحدات معالجة الرسومات Pascal غير dp4a لتنسيقات التكميم Q2_K وQ4_K وQ5_K وQ6_K.
يوفر هذا الإصدار ملفات ثنائية لنظام macOS (Apple Silicon وIntel) وLinux (CPU وVulkan وROCm وOpenVINO وSYCL) وWindows (CPU وCUDA 12/13 وVulkan وOpenVINO وSYCL وROCm) وAndroid وopenEuler.