Proyek llama.cpp merilis versi b10456, yang mencakup perbaikan kritis untuk backend SYCL dalam peluncuran kernel salinan terkuantisasi. Pembaruan ini menyesuaikan jumlah thread dan blok agar sebanding dengan ukuran kuantisasi, secara efektif mengurangi masalah under- dan over-subscription.

  • Memperbaiki jumlah thread/blok dalam peluncuran kernel cpy terkuantisasi (PR #27160).
  • Throughput untuk jalur q4_0 -> f32 pada Arc 70 meningkat dari 20.21 GB/s menjadi 158.19 GB/s.
  • Jalur kuantisasi lainnya menunjukkan peningkatan kinerja yang stabil.
  • Binari tersedia untuk macOS, Linux, Windows, Android, dan openEuler di berbagai backend CPU, CUDA, Vulkan, ROCm, OpenVINO, dan SYCL.

Perubahan ini secara signifikan meningkatkan efisiensi transfer data pada GPU Intel Arc menggunakan backend SYCL, mengatasi hambatan kinerja utama dalam operasi terkuantisasi.