El proyecto llama.cpp ha añadido soporte para la arquitectura del modelo Qwen3.8-Flash-Next (qwen4exp), implementando sus componentes específicos, incluidas las hiperconexiones, redes delta con compuerta, Mezcla de Expertos y embeddings de hash n-gram PLE.
- Añade la infraestructura GGUF para qwen4_exp, incluidos tensores para hiperconexiones de bajo rango y embeddings PLE.
- Implementa el grafo de decodificación con flujos residuales de hiperconexión y bloques MoE, validado contra vLLM con alta concordancia top-1.
- Introduce el hash del lado del host para los embeddings n-gram PLE utilizando enteros de 64 bits debido a los grandes valores de multiplicador.
- Añade soporte opcional para caché de claves del indexador en llama_memory_hybrid para habilitar la atención dispersa QSA para modelos híbridos.
Esta adición permite la carga e inferencia de modelos Qwen3.8-Flash-Next dentro de llama.cpp, ampliando su cobertura de arquitectura.