El proyecto llama.cpp ha añadido soporte para la arquitectura del modelo Qwen3.8-Flash-Next (qwen4exp), implementando sus componentes específicos, incluidas las hiperconexiones, redes delta con compuerta, Mezcla de Expertos y embeddings de hash n-gram PLE.

  • Añade la infraestructura GGUF para qwen4_exp, incluidos tensores para hiperconexiones de bajo rango y embeddings PLE.
  • Implementa el grafo de decodificación con flujos residuales de hiperconexión y bloques MoE, validado contra vLLM con alta concordancia top-1.
  • Introduce el hash del lado del host para los embeddings n-gram PLE utilizando enteros de 64 bits debido a los grandes valores de multiplicador.
  • Añade soporte opcional para caché de claves del indexador en llama_memory_hybrid para habilitar la atención dispersa QSA para modelos híbridos.

Esta adición permite la carga e inferencia de modelos Qwen3.8-Flash-Next dentro de llama.cpp, ampliando su cobertura de arquitectura.