Proyek llama.cpp telah merilis versi b11035, memperkenalkan dukungan untuk kernel perkalian matriks IQ3_S MMQ di backend Vulkan-nya.

  • Pembaruan ini mencakup kernel matmul IQ3_S MMQ baru untuk Vulkan.
  • Block_a_to_shmem sekarang melakukan pemuatan 2-byte untuk mengoptimalkan akses memori.
  • Pemeriksaan penyesuaian telah disesuaikan karena IQ3_S menggunakan ukuran tile K.
  • Binari tersedia untuk macOS, Linux, Windows, Android, dan openEuler di platform CPU, CUDA, ROCm, OpenVINO, SYCL, dan OpenCL.

Rilis ini menyediakan binari yang diperbarui untuk berbagai sistem operasi dan akselerator perangkat keras, memungkinkan pengguna memanfaatkan dukungan kuantisasi Vulkan baru.