Le projet llama.cpp a publié la compilation b11060, qui inclut une correction pour le modèle Mamba afin de garantir que l'entrée de projection d'étape temporelle soit contiguë. Ce changement résout les problèmes de disposition de la mémoire dans l'implémentation de Mamba.

  • Le module Mamba rend désormais l'entrée de projection d'étape temporelle contiguë pour éviter les erreurs.
  • Une optimisation ultérieure saute l'opération de copie contiguë après la normalisation dans le chemin Mamba.
  • La version fournit des binaires pour macOS (Apple Silicon et Intel), iOS, Linux (CPU, Vulkan, CUDA 12/13, ROCm, OpenVINO, SYCL), Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm), Android et openEuler.

Cette mise à jour assure la stabilité des modèles basés sur Mamba tout en maintenant un large support matériel dans l'écosystème llama.cpp.