Le projet llama.cpp a publié la version b10908, qui inclut une correction pour les threads inactifs dans les noyaux iq mul_mv restants pour ne00 < 1024. Ce changement généralise la logique de division des lignes à six noyaux spécifiques : iq1_s, iq1_m, iq2_xxs, iq2_xs, iq2_s et iq3_s.
- La correction traite les cas où les lignes ont moins de 32 morceaux, permettant aux threads de partager des morceaux et de prendre des tranches des lignes.
- Elle décale le pointeur de ligne src0 une fois dans les noyaux iq mul_mv car q2, dh, sc, qh et les signes sont dérivés de xr.
- L'implémentation intègre la division de ligne iq mul_mv dans offset0 pour maintenir x et ses pointeurs dérivés sur le chemin existant.
Cette version fournit des binaires pour macOS, Linux, Android, Windows et openEuler sur diverses architectures incluant CPU, CUDA, ROCm, Vulkan et SYCL.