Proyek llama.cpp telah menambahkan dukungan kernel Flash Attention (FA) untuk konfigurasi spesifik yang digunakan oleh MiniCPM3 di Apple Silicon. Perubahan ini mengatasi crash di mana flag `-fa auto` akan abort karena kurangnya instansiasi kernel untuk panjang kunci perhatian 96 dan panjang nilai 64.

  • Ditambahkan kernel tile pada (96, 64) untuk setiap tipe K/V yang sudah mendukung (96, 96).
  • Ditambahkan kernel vec untuk konfigurasi NE=4, karena ini adalah satu-satunya nilai di mana NL membagi DK/4 dan DV/4.
  • Uji diperbarui untuk menghindari cakupan slice vec FA yang redundan.

Pembaruan ini memungkinkan model MiniCPM3 berjalan dengan Flash Attention diaktifkan pada perangkat macOS dan iOS tanpa mengalami kesalahan kernel.