Le projet llama.cpp a publié la version b10657, introduisant de nouveaux noyaux binaires OpenCL pour les modèles à experts mixtes. Spécifiquement, la mise à jour ajoute `kernel_gemm_moe_q4_0_q8_1_dp4a_bin` et `kernel_gemm_moe_mxfp4_q8_1_dp4a_bin` pour prendre en charge le calcul efficace sur du matériel compatible.

  • Ajout de noyaux binaires OpenCL pour GEMO MOE avec les quantifications q4_0/q8_1 et mxfp4/q8_1.
  • Fourniture de binaires pour macOS (Apple Silicon et Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm), Android et openEuler.
  • Le support de KleidiAI sur Apple Silicon sous macOS reste désactivé dans cette version.

Cette mise à jour étend la compatibilité matérielle pour les modèles à experts mixtes en activant des implémentations spécifiques de noyaux OpenCL.