Proyek llama.cpp merilis versi b10791, memperkenalkan optimasi OpenCL yang signifikan untuk kepala model bahasa terkuantisasi dan operasi decoding GEMV. Pembaruan ini juga mencakup peningkatan GEMM batch-menengah yang relevan dengan decoding spekulatif dan prediksi multi-token.

  • Mengoptimalkan opencl quant lm_head / decode GEMV dan GEMM batch-menengah untuk decoding spekulatif/MTP.
  • Melindungi pendaftaran konversi kernel tiled_ns q4_K/q6_K untuk build non-Adreno.
  • Membatasi dispatch fusi MUL_MAT+GLU q4_K secara khusus ke perangkat keras Adreno.
  • Memerlukan tata letak bobot noshuffle di gerbang fusi GLU q4_K.
  • Mencegah pengambilan jalur GEMV mrow f16 tervektorisasi pada stride baris yang tidak sejajar.
  • Mengaktifkan decode GEMV split-K q4_K hanya di mana peningkatan kinerja terukur.
  • Membatasi default GEMV lm_head/embed tiled ke arsitektur X2E/A8X.

Rilis ini menyediakan biner untuk macOS, iOS, Linux, Windows, Android, dan openEuler di seluruh CPU, GPU, dan berbagai backend akselerator.