Le projet llama.cpp a publié la version b10181, qui inclut une correction dans ggml-cuda pour désactiver la Quantification de Multiplication Matricielle (MMQ) sur les GPU disposant de moins de 48 KiB de mémoire partagée par bloc. Auparavant, les configurations MMQ supposaient un minimum de 48 KiB, provoquant des erreurs fatales sur des appareils tels que les GPU NVIDIA Pascal et Moore Threads MTT S70 où la taille du tuile dépassait la mémoire disponible.

  • La correction ajoute une garde dans `ggml_cuda_should_use_mmq()` pour vérifier le budget de mémoire partagée avant de sélectionner les tuiles MMQ.
  • Les appareils disposant d'une mémoire insuffisante basculent désormais vers le chemin BLAS pendant la phase de préremplissage, évitant les plantages tout en maintenant les performances de génération de tokens.
  • Cette modification s'applique à tout appareil CUDA signalant moins de 48 KiB de mémoire partagée par bloc, et pas seulement aux appareils MUSA QY1 spécifiques.

Cette mise à jour prévient les crashs sur le matériel ancien ou spécialisé disposant d'une mémoire partagée limitée, garantissant une inférence stable en utilisant automatiquement le backend BLAS compatible.