El proyecto llama.cpp lanzó la versión b10615, introduciendo operaciones vectoriales flash-attention cuantizadas (Q, NE) ajustadas por dispositivo para el backend de Metal.

  • Se añadieron 53 instanciaciones de vectores flash-attn f16, aumentando el total de 80 a 133.
  • Se implementó una tabla de ajuste y cableado de despacho con respaldo de capacidad de memoria compartida.
  • Se extendió el ajuste de vectores para admitir cachés KV cuantizados.
  • Se incluyeron parámetros ajustados para dispositivos M1 Pro, M2 Ultra y M5 Max.

Esta actualización optimiza el rendimiento en hardware Apple Silicon aplicando resultados de ajuste específicos al backend de Metal.