El proyecto llama.cpp ha lanzado la compilación b11333, que introduce soporte bfloat16 para las operaciones MUL_MAT, MUL_MAT_ID y GET_ROWS dentro de su backend WebGPU.

Esta actualización está incluida en los binarios precompilados para macOS (Apple Silicon e Intel), iOS, Linux (Ubuntu x64, arm64, s390x), Windows, Android y openEuler. El lanzamiento proporciona compilaciones para varios aceleradores de hardware, incluyendo CUDA 12 y 13, Vulkan, ROCm 10.0, OpenVINO, SYCL y Snapdragon NPUs.

La adición de precisión bfloat16 a estas operaciones matriciales específicas de WebGPU permite un cálculo más eficiente en GPUs compatibles.