O projeto llama.cpp lançou a compilação b11333, que introduz suporte a bfloat16 para as operações MUL_MAT, MUL_MAT_ID e GET_ROWS dentro de seu backend WebGPU.
Esta atualização está incluída nos binários pré-compilados para macOS (Apple Silicon e Intel), iOS, Linux (Ubuntu x64, arm64, s390x), Windows, Android e openEuler. O lançamento fornece compilações para vários aceleradores de hardware, incluindo CUDA 12 e 13, Vulkan, ROCm 10.0, OpenVINO, SYCL e Snapdragon NPUs.
A adição da precisão bfloat16 a essas operações matriciais específicas do WebGPU permite um cálculo mais eficiente em GPUs compatíveis.