O projeto llama.cpp adicionou suporte à arquitetura do modelo Qwen3.8-Flash-Next (qwen4exp), implementando seus componentes específicos, incluindo hiperconexões, redes delta com gateamento, Mistura de Especialistas e embeddings de hash n-gram PLE.
- Adiciona a infraestrutura GGUF para qwen4_exp, incluindo tensores para hiperconexões de baixo posto e embeddings PLE.
- Implementa o grafo de decodificação com fluxos residuais de hiperconexão e blocos MoE, validado contra vLLM com alta concordância top-1.
- Introduz hash do lado do host para embeddings n-gram PLE usando inteiros de 64 bits devido aos grandes valores de multiplicador.
- Adiciona suporte opcional ao cache de chaves do indexador em llama_memory_hybrid para habilitar atenção esparsa QSA para modelos híbridos.
Esta adição permite o carregamento e inferência de modelos Qwen3.8-Flash-Next dentro do llama.cpp, ampliando sua cobertura de arquitetura.