El proyecto llama.cpp ha lanzado la versión b10336, que incluye una refactorización de varios archivos wgsl y la simplificación de flash_attn wgsl dentro del componente ggml-webgpu.

Esta actualización proporciona binarios para macOS (Apple Silicon e Intel), iOS, Linux (Ubuntu con CPU, Vulkan, ROCm 7.2, OpenVINO, SYCL), Android, Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL, HIP) y plataformas openEuler.

El lanzamiento también incluye la compilación estándar de la interfaz de usuario para que los usuarios interactúen con el motor de inferencia del modelo.