Proyek llama.cpp telah menambahkan dukungan untuk arsitektur model Qwen3.8-Flash-Next (qwen4exp), mengimplementasikan komponen spesifiknya termasuk hiper-koneksi, jaringan delta tergerbang, Campuran Ahli, dan embedding hash n-gram PLE.
- Menambahkan infrastruktur GGUF untuk qwen4_exp, termasuk tensor untuk hiper-koneksi rank-rendah dan embedding PLE.
- Mengimplementasikan grafik decode dengan aliran residual hiper-koneksi dan blok MoE, divalidasi terhadap vLLM dengan kesepakatan top-1 yang tinggi.
- Memperkenalkan hashing sisi host untuk embedding n-gram PLE menggunakan bilangan bulat 64-bit karena nilai pengali yang besar.
- Menambahkan dukungan cache kunci indexer opsional di llama_memory_hybrid untuk mengaktifkan perhatian jarang QSA untuk model hibrida.
Penambahan ini memungkinkan pemuatan dan inferensi model Qwen3.8-Flash-Next dalam llama.cpp, memperluas cakupan arsitekturnya.