llama.cpp プロジェクトは、Qwen3.8-Flash-Next (qwen4exp) モデルアーキテクチャのサポートを追加し、ハイパー接続、ゲート付きデルタネット、Experts of Mixture、PLE n-gram ハッシュ埋め込みなどの特定のコンポーネントを実装しました。
- qwen4_exp 用の GGUF パイプラインを追加し、低ランクのハイパー接続と PLE 埋め込み用のテンソルを含みます。
- ハイパー接続残差ストリームと MoE ブロックを持つデコードグラフを実装し、vLLM との高 top-1 合意で検証されました。
- 大きな乗数値のため、64 ビット整数を使用して PLE n-gram 埋め込みのホスト側ハッシュを導入しました。
- ハイブリッドモデルの QSA 疎注意を有効にするため、llama_memory_hybrid にオプションのインデクサキーキャッシュサポートを追加しました。
この追加により、llama.cpp 内で Qwen3.8-Flash-Next モデルの読み込みと推論が可能になり、アーキテクチャのカバレッジが拡張されました。