Проект llama.cpp выпустил версию b10336, которая включает рефакторинг нескольких файлов wgsl и упрощение flash_attn wgsl в компоненте ggml-webgpu.
Это обновление предоставляет бинарные файлы для macOS (Apple Silicon и Intel), iOS, Linux (Ubuntu с CPU, Vulkan, ROCm 7.2, OpenVINO, SYCL), Android, Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL, HIP) и платформ openEuler.
Выпуск также включает стандартную сборку UI для взаимодействия пользователей с движком вывода модели.