llama.cpp プロジェクトはバージョン b10908 をリリースし、ne00 < 1024 の残りの iq mul_mv カーネルにおけるアイドルスレッドの修正を含んでいます。この変更は、行分割ロジックを6つの特定のカーネルに一般化します:iq1_s、iq1_m、iq2_xxs、iq2_xs、iq2_s、および iq3_s。
- 修正は、行が32チャンク未満を持つ場合に対応し、スレッドがチャンクを共有して行のスライスを取得できるようにします。
- iq mul_mv カーネルでは、q2、dh、sc、qh、および符号が xr から派生されるため、src0 行ポインタを1回オフセットします。
- 実装は、iq mul_mv の行分割を offset0 に折りたたみ、x およびその派生ポインタを既存のパス上に保ちます。
このリリースでは、macOS、Linux、Android、Windows、openEuler 向けに、CPU、CUDA、ROCm、Vulkan、SYCL を含むさまざまなアーキテクチャ用のバイナリが提供されています。