O projeto llama.cpp lançou a versão b10908, que inclui uma correção para threads ociosas nos kernels iq mul_mv restantes para ne00 < 1024. Esta alteração generaliza a lógica de divisão de linhas para seis kernels específicos: iq1_s, iq1_m, iq2_xxs, iq2_xs, iq2_s e iq3_s.
- A correção aborda casos onde as linhas têm menos de 32 chunks, permitindo que as threads compartilhem chunks e peguem fatias das linhas.
- Ela desloca o ponteiro da linha src0 uma vez nos kernels iq mul_mv já que q2, dh, sc, qh e sinais são derivados de xr.
- A implementação combina a divisão de linha iq mul_mv com offset0 para manter x e seus ponteiros derivados no caminho existente.
Este lançamento fornece binários para macOS, Linux, Android, Windows e openEuler em várias arquiteturas incluindo CPU, CUDA, ROCm, Vulkan e SYCL.