O lançamento b11413 do llama.cpp introduz uma nova implementação de atenção flash esparsa em Vulkan que suporta tensores de Chave e Valor quantizados. Esta atualização aborda problemas de desempenho no método anterior de compactação, que era muito custoso para tarefas de decodificação com janelas de contexto grandes.

  • A nova abordagem divide as linhas em segmentos contíguos processados por subgrupos ou threads, usando contagem de votos sobre carregamentos coalescidos para manter uma lista de índices ascendente.
  • Binários pré-compilados estão disponíveis para macOS (Apple Silicon e Intel), Linux (CPU, Vulkan, CUDA 12/13, ROCm, OpenVINO, SYCL, Snapdragon), Windows (CPU, Vulkan, CUDA, OpenVINO, SYCL, ROCm), Android e iOS.
  • O lançamento também inclui a interface do usuário do llama.cpp e atestações para verificação de segurança.