O projeto llama.cpp lançou a compilação b10835, que inclui uma correção para um problema de barreira divergente na implementação do ggml-cuda para flash attention f16. Esta atualização também aborda a configuração duplicada do ponteiro de metadados no mesmo módulo.

  • Corrige a barreira divergente no ggml-cuda flash attention f16 (PR #27870).
  • Previne a configuração duplicada do ponteiro de metadados no ggml-cuda.

Esta versão fornece binários atualizados para macOS, Linux, Windows, Android e openEuler em vários backends de CPU e GPU, incluindo CUDA, Vulkan, ROCm e SYCL.