Backend Metal memperkenalkan kernel perkalian matriks baru untuk 2 hingga 16 baris sumber, memungkinkan dekode spekulatif yang lebih cepat pada perangkat Apple Silicon yang tidak memiliki API tensor. Kernel ini melakukan dekuantisasi bobot sekali dan membagi dimensi K di seluruh threadgroup, memberikan peningkatan kinerja yang signifikan dibandingkan pendekatan mat-vec sebelumnya.

  • Mengimplementasikan kernel MMA spesifik untuk Q4_0, Q8_0, Q5_K, dan jalur generik untuk F32, F16, serta jenis kuantisasi lainnya.
  • Mengaktifkan kernel ini pada perangkat keras MTLGPUFamilyApple7+ ketika jumlah baris melebihi ambang batas di mana mereka mengungguli kernel mat-vec.
  • Menambahkan logika fusi untuk menggabungkan operasi MUL_MAT + ADD dan mengelompokkan hingga 16 salinan f32 berurutan dengan tata letak yang sama menjadi satu dispatch.
  • Memperbarui pengoptimal grafik dan encoder untuk menangani properti perangkat, pemeriksaan konkurensi, dan pelacakan tampilan untuk grup yang difusikan.

Optimasi ini mengatasi regresi kinerja dalam dekode spekulatif pada perangkat keras M3 Ultra dengan memastikan bahwa operasi tensor tetap efisien bahkan dengan ukuran batch kecil.