Le projet llama.cpp a ajouté le support de l'architecture du modèle Qwen3.8-Flash-Next (qwen4exp), en implémentant ses composants spécifiques, notamment les hyperconnexions, les réseaux delta à gâchette, le Mélange d'Experts et les embeddings de hachage n-gramme PLE.
- Ajoute la structure GGUF pour qwen4_exp, y compris les tenseurs pour les hyperconnexions de bas rang et les embeddings PLE.
- Implémente le graphe de décodage avec des flux résiduels d'hyperconnexion et des blocs MoE, validé contre vLLM avec un accord top-1 élevé.
- Introduit le hachage côté hôte pour les embeddings n-gramme PLE en utilisant des entiers 64 bits en raison des grandes valeurs de multiplicateur.
- Ajoute un support optionnel de cache de clés d'indexeur dans llama_memory_hybrid pour activer l'attention creuse QSA pour les modèles hybrides.
Cette ajout permet le chargement et l'inférence des modèles Qwen3.8-Flash-Next au sein de llama.cpp, élargissant sa couverture d'architecture.