Proyek llama.cpp merilis build b10863, yang mencakup perbaikan untuk thread menganggur pada kernel `mul_mv_iq3_xxs` di Metal ketika `ne00` kurang dari 1024. Pembaruan ini mengatasi masalah simdgroup setengah-menganggur dengan memperkenalkan kernel split terpisah untuk dimensi matriks tertentu.

  • Memperbaiki simdgroup setengah-menganggur di `kernel_mul_mv_iq3_xxs_f32` untuk `ne00 < 1024`.
  • Mempertahankan `N_R0_IQ3_XXS = 4` dan mendispatch kernel split 8-baris terpisah ketika `ne00/32 < 32` dan membagi 32.
  • Menggunakan konstanta fungsi untuk memilih split baris `iq3_xxs` alih-alih instansiasi kernel terpisah.

Rilis ini menyediakan biner untuk macOS, iOS, Linux, Android, Windows, dan openEuler di berbagai backend perangkat keras termasuk CPU, CUDA, ROCm, Vulkan, dan OpenVINO.