Le projet llama.cpp a publié la version b10632, qui introduit une optimisation MMA SSD fractionnée pour le pré-remplissage de Mamba-2 via ggml-metal.
- Ajoute des noyaux WIP SSM_SCAN SSD fractionnés pour le pré-remplissage multi-jeton sur Metal.
- Supprime le chemin SSD scalaire au profit du MMA combiné avec une queue séquentielle.
- Réserve K jetons pour les instantanés de rollback du noyau séquentiel et réinitialise la concurrence entre MMA et seq tail.
- Spécialise la queue ssm_scan avec un modèle et met à jour les constantes pour plus de clarté.
Cette mise à jour fournit des binaires pour macOS, iOS, Linux, Windows, Android et openEuler sur divers backends matériels, y compris CPU, CUDA, ROCm, Vulkan et OpenVINO.