Proyek llama.cpp merilis build b10988, memperkenalkan perubahan pada backend OpenCL khususnya untuk model Mixture of Experts (MoE). Pembaruan ini mengimplementasikan logika untuk memilih perkalian matriah ahli MoE berdasarkan ukuran batch selama dekoding spekulatif dan prediksi multi-token.

  • Gerbang operasi GEMM q4_0 MoE pra-dibangun berdasarkan jumlah routing.
  • Berhenti menulis nol ke slot aktivasi MoE yang dipad untuk meningkatkan efisiensi.
  • Menyediakan biner untuk macOS, Linux, Windows, Android, dan openEuler melalui platform CPU, CUDA, ROCm, Vulkan, OpenVINO, SYCL, dan Adreno.