Le projet llama.cpp a publié la version b11390, qui inclut une correction pour une erreur de mémoire CUDA MMQ survenant lorsque le nombre d'experts était significativement supérieur à la taille du micro-lot.
- Résout une erreur de mémoire dans le backend CUDA liée à la gestion de Mixture-of-Experts (MMQ).
- Fournit des binaires pour macOS (Apple Silicon et Intel), Linux (CPU, Vulkan, CUDA 12/13, ROCm, OpenVINO, SYCL, Snapdragon), Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm), Android et openEuler.
- Inclut une version mise à jour de l'interface utilisateur.
Cette mise à jour garantit la stabilité pour les utilisateurs exécutant des modèles Mixture-of-Experts sur du matériel CUDA en empêchant l'erreur d'accès mémoire spécifique.