Le projet llama.cpp a publié la compilation b11370, qui inclut une optimisation CUDA pour fusionner les experts partagés dans l'architecture Mixture of MoE avec Quantification Vectorielle (MMVQ). Ce changement fait partie de la pull request #29184 et traite également des vérifications de tampon nul et de la gestion des arguments pour stride_col_dst.

  • Fusionne les experts partagés dans MMVQ pour les backends CUDA.
  • Ajoute des vérifications nulles pour les tampons afin d'améliorer la stabilité.
  • Déplace stride_col_dst vers les arguments de fusion.

Cette version fournit des binaires mis à jour pour macOS, Linux, Windows, Android et iOS sur divers accélérateurs matériels, y compris CPU, Vulkan, ROCm, OpenVINO, SYCL et Snapdragon.