Le projet vLLM a publié la version 0.29.0, qui inclut une correction de bug principale concernant le cache de préfixe dense.
- La mise à jour applique le paramètre par défaut du cache de préfixe dense spécifiquement aux modèles hybrides.
Le projet vLLM a publié la version 0.29.0, qui inclut une correction de bug principale concernant le cache de préfixe dense.
DeepSeek AI a publié DeepSeek-V4.1-Flash, un modèle Mixture-of-Experts multimodal disposant d'une fenêtre de contexte de 1 million de tokens et d'un cache KV FP4 qui réduit l'empreinte globale du cache à 890 octets par token. Le modèle utilise une architecture encodeur-décodeur causal et Compressed Sparse Attention 2 (CSA2) pour réduire considérablement les besoins en mémoire tout en maintenant les performances.
Le projet llama.cpp a publié la compilation b10889, qui inclut une optimisation de la mémoire pour éviter d'allouer le cache V pour l'indexeur car il n'est pas utilisé.
Le projet llama.cpp a publié la compilation b10888, qui inclut une nouvelle fonctionnalité pour ajouter des étiquettes de débogage de tampon de commandes pour les profileurs GPU dans le backend Vulkan.
Le projet llama.cpp a publié la construction b10886, qui introduit le support des intrinsèques vectoriels Q1_0 pour l'architecture s390x. Cette mise à jour inclut l'implémentation de `ggml_vec_dot_q1_0_q8_0` et met à jour la documentation pour refléter la nouvelle capacité.
Le projet llama.cpp a publié la compilation b10883, qui inclut des mises à jour significatives du backend Vulkan. Le changement principal consiste à utiliser des constantes de spécification pour les opérations de multiplication matrice-matrice de type A afin d'améliorer la compilation et les performances des shaders.
Nous utilisons des cookies pour mesurer l'audience et améliorer le site. Vous pouvez accepter ou refuser les cookies analytiques. Politique de confidentialité