Le projet llama.cpp a publié la compilation b10988, introduisant des modifications au backend OpenCL spécifiquement pour les modèles Mixture of Experts (MoE). La mise à jour implémente une logique pour choisir la multiplication matricielle de l'expert MoE en fonction de la taille du lot lors du décodage spéculatif et de la prédiction multi-tokens.

  • Gater l'opération GEMM q4_0 MoE pré-construite en fonction du nombre de routages.
  • Arrêter d'écrire des zéros dans les emplacements d'activation MoE rembourrés pour améliorer l'efficacité.
  • Fournir des binaires pour macOS, Linux, Windows, Android et openEuler via les plateformes CPU, CUDA, ROCm, Vulkan, OpenVINO, SYCL et Adreno.