Le projet llama.cpp a publié la version b11390, qui inclut une correction pour une erreur de mémoire CUDA MMQ survenant lorsque le nombre d'experts était significativement supérieur à la taille du micro-lot.

  • Résout une erreur de mémoire dans le backend CUDA liée à la gestion de Mixture-of-Experts (MMQ).
  • Fournit des binaires pour macOS (Apple Silicon et Intel), Linux (CPU, Vulkan, CUDA 12/13, ROCm, OpenVINO, SYCL, Snapdragon), Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm), Android et openEuler.
  • Inclut une version mise à jour de l'interface utilisateur.

Cette mise à jour garantit la stabilité pour les utilisateurs exécutant des modèles Mixture-of-Experts sur du matériel CUDA en empêchant l'erreur d'accès mémoire spécifique.