Proyek llama.cpp merilis build b10757, yang mencakup optimasi spesifik untuk backend Vulkan. Pembaruan ini menangani ukuran batch yang lebih besar dari 4 secara efisien untuk perkalian matriks-vektor IQ3_S ketika NUM_COLS lebih besar dari 4.
- Mencapai peningkatan kinerja 5x pada n=8 untuk konfigurasi mat-vec IQ3_S Vulkan yang ditentukan.
- Menambahkan dua kasus per jenis kuantisasi di k=16*256 ke sweep mat-vec all_types.
- Menyediakan biner untuk macOS (Apple Silicon dan Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, OpenCL, Vulkan, OpenVINO, SYCL, ROCm), dan openEuler.
Rilis ini memungkinkan pengguna menjalankan llama.cpp di berbagai platform perangkat keras dengan optimasi Vulkan yang diperbarui untuk jenis kuantisasi tertentu.