llama.cpp 프로젝트는 하이퍼 연결, 게이트드 델타 넷, 전문가 혼합(MoE), PLE n-gram 해시 임베딩을 포함한 특정 구성 요소를 구현하여 Qwen3.8-Flash-Next (qwen4exp) 모델 아키텍처에 대한 지원을 추가했습니다.
- 저순위 하이퍼 연결 및 PLE 임베딩용 텐서를 포함하는 qwen4_exp 에 대한 GGUF 파이프라인을 추가합니다.
- 하이퍼 연결 잔여 스트림과 MoE 블록이 있는 디코드 그래프를 구현했으며, vLLM 과의 높은 top-1 일치로 검증되었습니다.
- 큰 승수 값으로 인해 64비트 정수를 사용하여 PLE n-gram 임베딩에 대한 호스트 측 해싱을 도입했습니다.
- 하이브리드 모델에 대한 QSA 희소 어텐션을 활성화하기 위해 llama_memory_hybrid 에 선택적 인덱서 키 캐시 지원을 추가했습니다.
이 추가 기능으로 llama.cpp 내에서 Qwen3.8-Flash-Next 모델을 로드하고 추론할 수 있게 되어 아키텍처 범위가 확장되었습니다.