El proyecto llama.cpp lanzó la versión b11140, que incluye una optimización de CUDA que habilita sparse-fa para el prefill dsv4. Esta actualización aborda problemas de rendimiento en el proceso de escaneo de máscaras de flash attention mediante la plantilla de kernels para permitir el desenrollado de bucles en tiempo de compilación.
- El bucle de consulta de `flash_attn_mask_to_sparse_indices` ahora está acotado en tiempo de compilación, reduciendo el tiempo de escaneo de 46 a 17 microsegundos para formas de decodificación dispersa con 49k columnas.
- Las comprobaciones de fuera de límites para el escaneo de la máscara dispersa se han trasladado al código del host, permitiendo que la operación dispersa en lote con contexto de 49k disminuya de 586 a 244 microsegundos.
Esta versión proporciona binarios para macOS, Linux, Windows, Android y openEuler a través de backends de CPU, GPU y NPU.