Proyek llama.cpp telah menambahkan catatan penyetelan vektor perhatian cepat (fa-vec) untuk GPU Apple M3 Max, M5, dan M5 Pro guna meningkatkan kinerja Metal.

  • Penyetelan untuk Apple M5 dihasilkan pada mesin M5 menggunakan tipe data f16 dan q8_0.
  • Catatan untuk Apple M5 Pro mencakup format F16, Q4_0, dan Q8_0 di seluruh 20 inti GPU.
  • Dukungan untuk M3 Max mencakup konfigurasi F16 dan Q8_0 pada MacBook Pro dengan 64GB dalam mode daya rendah.

Pembaruan ini memperluas kemampuan akselerasi Metal ke arsitektur Apple silicon yang lebih baru.