Proyek llama.cpp telah merilis versi b11390, yang mencakup perbaikan untuk kesalahan memori CUDA MMQ yang terjadi ketika jumlah ahli secara signifikan lebih besar dari ukuran mikro-batch.

  • Menyelesaikan kesalahan memori di backend CUDA terkait penanganan Mixture-of-Experts (MMQ).
  • Menyediakan biner untuk macOS (Apple Silicon dan Intel), Linux (CPU, Vulkan, CUDA 12/13, ROCm, OpenVINO, SYCL, Snapdragon), Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm), Android, dan openEuler.
  • Termasuk build UI yang diperbarui.

Pembaruan ini memastikan stabilitas bagi pengguna yang menjalankan model Mixture-of-Experts pada perangkat keras CUDA dengan mencegah kesalahan akses memori spesifik tersebut.