Proyek llama.cpp merilis versi b10723, yang mencakup optimasi spesifik untuk OpenCL pada perangkat keras grafis Intel Xe-LP. Pembaruan ini berfokus pada peningkatan kinerja generasi tensor (TG) dan praisi (PP) dengan menyesuaikan kernel kuantisasi.

  • Operasi mul_mv Q4_K dan Q5_K disesuaikan untuk meningkatkan nilai N_DST, memungkinkan penggunaan kembali aktivasi 2x pada perangkat Intel.
  • Konfigurasi tile 8x8 diimplementasikan untuk operasi mul_mm Q4_K dan Q5_K secara khusus untuk arsitektur Intel.
  • N_DST ditingkatkan dari 8 menjadi 16 untuk mul_mv Q4_K untuk lebih mengoptimalkan penanganan data.

Rilis ini menyediakan biner yang diperbarui untuk macOS, Linux, Windows, Android, dan iOS di berbagai backend termasuk CUDA, Vulkan, ROCm, dan SYCL.