Proyek llama.cpp merilis versi b10908, yang mencakup perbaikan untuk thread idle di kernel iq mul_mv yang tersisa untuk ne00 < 1024. Perubahan ini menggeneralisasi logika pemisahan baris ke enam kernel spesifik: iq1_s, iq1_m, iq2_xxs, iq2_xs, iq2_s, dan iq3_s.
- Perbaikan menangani kasus di mana baris memiliki kurang dari 32 chunk, memungkinkan thread berbagi chunk dan mengambil irisan baris.
- Ini menggeser penunjuk baris src0 sekali di kernel iq mul_mv karena q2, dh, sc, qh, dan tanda berasal dari xr.
- Implementasi menggabungkan pemisahan baris iq mul_mv ke offset0 untuk menjaga x dan penunjuk turunannya di jalur yang ada.
Rilis ini menyediakan biner untuk macOS, Linux, Android, Windows, dan openEuler di berbagai arsitektur termasuk CPU, CUDA, ROCm, Vulkan, dan SYCL.