llama.cpp 프로젝트는 WebGPU 백엔드 내에서 MUL_MAT, MUL_MAT_ID 및 GET_ROWS 작업에 대한 bfloat16 지원을 도입한 빌드 b11333을 출시했습니다.

이 업데이트는 macOS (Apple Silicon 및 Intel), iOS, Linux (Ubuntu x64, arm64, s390x), Windows, Android 및 openEuler의 사전 컴파일된 바이너리에 포함되어 있습니다. 이 릴리스는 CUDA 12 및 13, Vulkan, ROCm 10.0, OpenVINO, SYCL 및 Snapdragon NPUs를 포함한 다양한 하드웨어 가속기를 위한 빌드를 제공합니다.

이러한 특정 WebGPU 행렬 작업에 bfloat16 정밀도를 추가하면 호환되는 GPU에서 더 효율적인 계산을 수행할 수 있습니다.