El proyecto llama.cpp ha lanzado la compilación b10921, que incluye una corrección para WebGPU alineando las vinculaciones de tensores al tamaño del bloque de tipo. Este cambio asegura que las vistas cuantizadas por bloque reciban un desplazamiento de elemento válido en el shader recorriendo hacia atrás el desplazamiento de vinculación hasta que la distancia al tensor sea un número entero de bloques.

El lanzamiento proporciona binarios y frameworks para macOS (Apple Silicon e Intel), iOS, Linux (Ubuntu con backends de CPU, Vulkan, ROCm, OpenVINO y SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL y ROCm) y openEuler.

Esta actualización asegura el manejo correcto de tensores en los shaders de WebGPU mientras mantiene la compatibilidad con una amplia gama de arquitecturas de hardware e implementaciones de backend.