Rilis llama.cpp b10256 menyertakan perubahan untuk mem paralelkan kernel penggabungan tidak berurutan untuk perangkat SYCL. Pembaruan mengubah geometri peluncuran dari grup kerja satu jalur ke yang menggunakan `SYCL_CONCAT_BLOCK_SIZE`.

  • Kernel penggabungan tidak berurutan SYCL sekarang meluncurkan grup kerja yang lebih lebar untuk meningkatkan paralelisme.
  • Benchmark pada Arc Pro B70 dengan Qwen3.6-27B menunjukkan peningkatan throughput sebesar 9,4% (dari 920 menjadi 1006 t/s).
  • Rilis ini menyediakan biner untuk macOS, Linux, Windows, Android, dan openEuler melalui backend CPU, CUDA, Vulkan, ROCm, OpenVINO, dan SYCL.

Optimasi ini meningkatkan kinerja inferensi pada GPU Intel menggunakan backend SYCL.