O projeto llama.cpp lançou a versão b10201, que inclui uma melhoria chave no backend ggml-webgpu. Esta atualização melhora o desempenho do flash attention ao lidar com caches de chave-valor quantizados durante a geração de contexto longo.
- Processamento vetorial melhorado do flash attention para cache KV quantizado no ggml-webgpu.
- Correção de bugs relacionados à verificação do tipo de valor e atualização de comentários.
- Resolução de erros de compilação causados por rebasing.
- Binários fornecidos para macOS (Apple Silicon, Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, HIP, OpenVINO, SYCL) e openEuler.
Esta versão permite que os usuários executem o llama.cpp em uma ampla gama de plataformas de hardware, beneficiando-se de mecanismos de atenção otimizados para sequências mais longas.