Proyek llama.cpp merilis versi b10615, memperkenalkan operasi vektor flash-attention terkuantisasi (Q, NE) yang disesuaikan per-perangkat untuk backend Metal.
- Menambahkan 53 instansiasi vektor flash-attn f16, meningkatkan total dari 80 menjadi 133.
- Mengimplementasikan tabel penalaan dan kabel dispatch dengan fallback kapasitas memori bersama.
- Memperluas penalaan vektor untuk mendukung cache KV terkuantisasi.
- Termasuk parameter yang disesuaikan untuk perangkat M1 Pro, M2 Ultra, dan M5 Max.
Pembaruan ini mengoptimalkan kinerja pada perangkat keras Apple Silicon dengan menerapkan hasil penalaan spesifik ke backend Metal.