Le projet llama.cpp a publié la compilation b11333, qui introduit le support bfloat16 pour les opérations MUL_MAT, MUL_MAT_ID et GET_ROWS au sein de son backend WebGPU.

Cette mise à jour est incluse dans les binaires précompilés pour macOS (Apple Silicon et Intel), iOS, Linux (Ubuntu x64, arm64, s390x), Windows, Android et openEuler. La version propose des compilations pour divers accélérateurs matériels, y compris CUDA 12 et 13, Vulkan, ROCm 10.0, OpenVINO, SYCL et Snapdragon NPUs.

L'ajout de la précision bfloat16 à ces opérations matricielles WebGPU spécifiques permet un calcul plus efficace sur les GPU compatibles.