llama.cpp b10256 リリースには、SYCL デバイスの非連続結合カーネルを並列化する変更が含まれています。この更新は、起動ジオメトリを単一レーンのワークグループから `SYCL_CONCAT_BLOCK_SIZE` を使用するものに変更します。
- SYCL 非連続結合カーネルは、並列性を向上させるためにより広いワークグループを起動します。
- Qwen3.6-27B を搭載した Arc Pro B70 でのベンチマークでは、スループットが 9.4% 増加(920 から 1006 t/s)しました。
- このリリースは、CPU、CUDA、Vulkan、ROCm、OpenVINO、および SYCL バックエンド向けに、macOS、Linux、Windows、Android、openEuler のバイナリを提供します。
この最適化により、SYCL バックエンドを使用する Intel GPU での推論パフォーマンスが向上します。