Le projet llama.cpp a publié la version b10336, qui comprend une refactorisation de plusieurs fichiers wgsl et une simplification de flash_attn wgsl au sein du composant ggml-webgpu.
Cette mise à jour fournit des binaires pour macOS (Apple Silicon et Intel), iOS, Linux (Ubuntu avec CPU, Vulkan, ROCm 7.2, OpenVINO, SYCL), Android, Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL, HIP) et les plateformes openEuler.
La sortie comprend également la compilation standard de l'interface utilisateur pour permettre aux utilisateurs d'interagir avec le moteur d'inférence du modèle.