Proyek llama.cpp merilis versi b10615, memperkenalkan operasi vektor flash-attention terkuantisasi (Q, NE) yang disesuaikan per-perangkat untuk backend Metal.

  • Menambahkan 53 instansiasi vektor flash-attn f16, meningkatkan total dari 80 menjadi 133.
  • Mengimplementasikan tabel penalaan dan kabel dispatch dengan fallback kapasitas memori bersama.
  • Memperluas penalaan vektor untuk mendukung cache KV terkuantisasi.
  • Termasuk parameter yang disesuaikan untuk perangkat M1 Pro, M2 Ultra, dan M5 Max.

Pembaruan ini mengoptimalkan kinerja pada perangkat keras Apple Silicon dengan menerapkan hasil penalaan spesifik ke backend Metal.