O projeto llama.cpp lançou a versão b10615, introduzindo operações vetoriais flash-attention quantizadas (Q, NE) ajustadas por dispositivo para o backend do Metal.
- Adicionado 53 instâncias de vetores flash-attn f16, aumentando o total de 80 para 133.
- Implementada uma tabela de ajuste e roteamento de despacho com fallback de capacidade de memória compartilhada.
- Estendido o ajuste de vetores para suportar caches KV quantizados.
- Incluídos parâmetros ajustados para dispositivos M1 Pro, M2 Ultra e M5 Max.
Esta atualização otimiza o desempenho em hardware Apple Silicon aplicando resultados de ajuste específicos ao backend do Metal.