El proyecto llama.cpp lanzó la versión b10615, introduciendo operaciones vectoriales flash-attention cuantizadas (Q, NE) ajustadas por dispositivo para el backend de Metal.
- Se añadieron 53 instanciaciones de vectores flash-attn f16, aumentando el total de 80 a 133.
- Se implementó una tabla de ajuste y cableado de despacho con respaldo de capacidad de memoria compartida.
- Se extendió el ajuste de vectores para admitir cachés KV cuantizados.
- Se incluyeron parámetros ajustados para dispositivos M1 Pro, M2 Ultra y M5 Max.
Esta actualización optimiza el rendimiento en hardware Apple Silicon aplicando resultados de ajuste específicos al backend de Metal.