Проект llama.cpp выпустил версию b10201, которая включает ключевое улучшение бэкенда ggml-webgpu. Это обновление повышает производительность flash attention при обработке квантованных ключ-значительных кэшей во время генерации длинных контекстов.
- Улучшена векторная обработка flash attention для квантованного KV кэша в ggml-webgpu.
- Исправлены ошибки, связанные с проверкой типа значения, и обновлены комментарии.
- Разрешены ошибки сборки, вызванные ребазингом.
- Предоставлены бинарные файлы для macOS (Apple Silicon, Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, HIP, OpenVINO, SYCL) и openEuler.
Это обновление позволяет пользователям запускать llama.cpp на широком спектре аппаратных платформ, получая преимущества оптимизированных механизмов внимания для более длинных последовательностей.