O projeto llama.cpp lançou a versão b10615, introduzindo operações vetoriais flash-attention quantizadas (Q, NE) ajustadas por dispositivo para o backend do Metal.

  • Adicionado 53 instâncias de vetores flash-attn f16, aumentando o total de 80 para 133.
  • Implementada uma tabela de ajuste e roteamento de despacho com fallback de capacidade de memória compartilhada.
  • Estendido o ajuste de vetores para suportar caches KV quantizados.
  • Incluídos parâmetros ajustados para dispositivos M1 Pro, M2 Ultra e M5 Max.

Esta atualização otimiza o desempenho em hardware Apple Silicon aplicando resultados de ajuste específicos ao backend do Metal.