O projeto llama.cpp lançou a versão b10336, que inclui uma refatoração de vários arquivos wgsl e simplificação do flash_attn wgsl dentro do componente ggml-webgpu.

Esta atualização fornece binários para macOS (Apple Silicon e Intel), iOS, Linux (Ubuntu com CPU, Vulkan, ROCm 7.2, OpenVINO, SYCL), Android, Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL, HIP) e plataformas openEuler.

O lançamento também inclui a compilação padrão da interface do usuário para que os usuários interajam com o mecanismo de inferência do modelo.