Proyek llama.cpp merilis versi b10723, yang mencakup optimasi spesifik untuk OpenCL pada perangkat keras grafis Intel Xe-LP. Pembaruan ini berfokus pada peningkatan kinerja generasi tensor (TG) dan praisi (PP) dengan menyesuaikan kernel kuantisasi.
- Operasi mul_mv Q4_K dan Q5_K disesuaikan untuk meningkatkan nilai N_DST, memungkinkan penggunaan kembali aktivasi 2x pada perangkat Intel.
- Konfigurasi tile 8x8 diimplementasikan untuk operasi mul_mm Q4_K dan Q5_K secara khusus untuk arsitektur Intel.
- N_DST ditingkatkan dari 8 menjadi 16 untuk mul_mv Q4_K untuk lebih mengoptimalkan penanganan data.
Rilis ini menyediakan biner yang diperbarui untuk macOS, Linux, Windows, Android, dan iOS di berbagai backend termasuk CUDA, Vulkan, ROCm, dan SYCL.