llama.cpp 项目已添加对 Qwen3.8-Flash-Next (qwen4exp) 模型架构的支持,实现了其特定组件,包括超连接、门控 delta 网络、专家混合(MoE)和 PLE n-gram 哈希嵌入。
- 为 qwen4_exp 添加了 GGUF 支持,包括用于低秩超连接和 PLE 嵌入的张量。
- 实现了带有超连接残差流和 MoE 块的解码图,并与 vLLM 进行了验证,top-1 一致性很高。
- 由于乘数数值较大,引入使用 64 位整数的 PLE n-gram 嵌入主机端哈希。
- 在 llama_memory_hybrid 中添加了可选的索引器键缓存支持,以启用混合模型的 QSA 稀疏注意力。
此添加功能使 llama.cpp 能够加载和推理 Qwen3.8-Flash-Next 模型,扩展了其架构覆盖范围。