Proyek llama.cpp telah merilis versi b11390, yang mencakup perbaikan untuk kesalahan memori CUDA MMQ yang terjadi ketika jumlah ahli secara signifikan lebih besar dari ukuran mikro-batch.
- Menyelesaikan kesalahan memori di backend CUDA terkait penanganan Mixture-of-Experts (MMQ).
- Menyediakan biner untuk macOS (Apple Silicon dan Intel), Linux (CPU, Vulkan, CUDA 12/13, ROCm, OpenVINO, SYCL, Snapdragon), Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm), Android, dan openEuler.
- Termasuk build UI yang diperbarui.
Pembaruan ini memastikan stabilitas bagi pengguna yang menjalankan model Mixture-of-Experts pada perangkat keras CUDA dengan mencegah kesalahan akses memori spesifik tersebut.