Proyek llama.cpp merilis build b10714, yang mencakup optimasi khusus untuk backend Vulkan yang menargetkan perangkat keras AMD Strix Halo. Pembaruan ini menyesuaikan jumlah baris perkalian matriks-vektor untuk meningkatkan kinerja selama inferensi batch.

  • Vulkan: Menetapkan 4 baris statis untuk operasi mat-vec pada arsitektur RDNA3 dengan lebih dari empat kolom, karena konfigurasi ini memiliki hasil benchmark yang lebih cepat daripada pengaturan default.
  • Vulkan: Menerapkan pengaturan statis 4 baris untuk mul_mat_vec_id pada mesin Strix Halo, terbukti lebih cepat di berbagai jenis dan ukuran batch dibandingkan dengan pengaturan default.

Perubahan ini memberikan peningkatan kinerja yang nyata bagi pengguna yang menjalankan llama.cpp pada GPU berbasis RDNA3 seperti Strix Halo.