Proyek llama.cpp merilis versi b10702, yang mencakup optimasi spesifik untuk jalur dot-product kuantisasi Q2_0 pada arsitektur gfx1201 dari AMD. Pembaruan ini memperluas implementasi HIP untuk menggunakan instruksi permutasi amdgcn native, meningkatkan kinerja untuk konfigurasi perangkat keras tertentu ini.
- Mengoptimalkan `vec_dot_q2_0_q8_1` dengan permutasi amdgcn native untuk gfx1201.
- Memperluas optimasi permutasi Q2_0 HIP dan menghapus pengaman ketersediaan yang redundan.
- Mengoptimalkan unpacking MMQ Q2_0 HIP menggunakan instruksi permutasi native.
- Memulihkan penanganan indeks ubin MMQ dan memberi label pada pengaman preprocessor HIP dalam kode CUDA.
Rilis ini menyediakan biner untuk macOS, Linux, Windows, Android, dan openEuler melalui CPU, GPU (CUDA, ROCm, Vulkan, OpenCL), dan backend khusus seperti OpenVINO dan SYCL.