Le projet llama.cpp a publié la compilation b10593, qui traite des problèmes critiques liés à l'architecture du modèle DeepseekV4. La mise à jour résout spécifiquement un échec de rollback survenu lors du traitement de séquences multiples.
- Corrige la gestion du rollback de DeepseekV4 pour les contextes à séquences multiples.
- Corrige les procédures générales de chargement du modèle.
- Rend les opérations de rollback en attente à usage unique pour prévenir la corruption de l'état.
- Garantit que le cache est effacé uniquement pour l'ID de séquence spécifique lors des chargements complets.
- Ajoute des assertions pour les ratios de compression et rend la topologie du graphe statique.
Cette version améliore la stabilité pour les utilisateurs exécutant des modèles DeepseekV4 avec plusieurs séquences. Elle fournit également des binaires mis à jour pour macOS, Linux, Windows, Android et iOS sur divers backends matériels incluant CPU, CUDA, ROCm et Vulkan.