Le projet llama.cpp a publié la compilation b11382, qui inclut une mise à jour majeure de son backend WebGPU. Cette version ajoute le support des nombres en virgule flottante 16 bits (f16) spécifiquement pour les opérations `fill` et `set_rows` au sein de l'implémentation WebGPU.
- Le changement de code source est suivi dans la pull request #29897 du dépôt ggml-org/llama.cpp.
- Des binaires sont fournis pour macOS (Apple Silicon et Intel), iOS, Linux (CPU, Vulkan, CUDA 12/13, ROCm, OpenVINO, SYCL, Snapdragon), Windows (CPU, OpenCL, CUDA, Vulkan, OpenVINO, SYCL, ROCm), Android et openEuler.
- La version inclut également le binaire standard de l'interface utilisateur llama.cpp.