Proyek llama.cpp telah merilis versi b10203, yang memperkenalkan dukungan untuk format kuantisasi q2_0 dalam operasi perkalian matriks berbasis SYCL. Pembaruan ini memperluas kompatibilitas pustaka untuk skenario akselerasi perangkat keras tertentu.
- Menambahkan dukungan untuk q2_0 di mul_mat melalui PR #26231.
- Memperluas cakupan ke kasus q2_0 tambahan di dalam backend SYCL.
- Menyediakan biner untuk macOS (Apple Silicon dan Intel), iOS, Linux (CPU, Vulkan, ROCm 7.2, OpenVINO, SYCL FP32/FP16), Android, Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL, HIP), dan openEuler.
Rilis ini memungkinkan pengguna memanfaatkan kuantisasi q2_0 pada perangkat yang kompatibel dengan SYCL, memperluas rentang konfigurasi perangkat keras yang didukung untuk inferensi model yang efisien.