O projeto llama.cpp lançou a compilação b10781, que inclui uma correção para o caminho de desquantização da atenção rápida (FA) do Vulkan. A atualização resolve um problema em que o shader verificava incorretamente `nb[3]` mesmo quando `ne[3] == 1`, fazendo com que o caminho só fosse ativado quando o cache estivesse cheio.
- Pula a verificação de `nb[3]` quando `ne[3] == 1` porque o shader nunca a lê para um único fluxo.
- Resolve um erro de lógica em que as visualizações do cache carregavam o passo de buffer completo, reduzindo a verificação antiga para `n_kv == kv_size`.
- Fornece binários para macOS (Apple Silicon e Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm) e openEuler.
Esta correção garante que o caminho de desquantização FA do Vulkan seja ativado corretamente durante a inferência, em vez de ser restrito a estados de cache completo.