Proyek llama.cpp telah merilis build b11333, yang memperkenalkan dukungan bfloat16 untuk operasi MUL_MAT, MUL_MAT_ID, dan GET_ROWS di dalam backend WebGPU-nya.

Pembaruan ini disertakan dalam binaris pra-kompilasi untuk macOS (Apple Silicon dan Intel), iOS, Linux (Ubuntu x64, arm64, s390x), Windows, Android, dan openEuler. Rilis ini menyediakan build untuk berbagai akselerator perangkat keras, termasuk CUDA 12 dan 13, Vulkan, ROCm 10.0, OpenVINO, SYCL, dan Snapdragon NPUs.

Penambahan presisi bfloat16 ke operasi matriks WebGPU spesifik ini memungkinkan komputasi yang lebih efisien pada GPU yang kompatibel.