A versão llama.cpp b10256 inclui uma alteração para paralelizar o kernel de concatenação não contígua para dispositivos SYCL. A atualização modifica a geometria de lançamento de um grupo de trabalho de faixa única para um que utiliza `SYCL_CONCAT_BLOCK_SIZE`.

  • O kernel de concatenação não contígua do SYCL agora lança um grupo de trabalho mais largo para melhorar o paralelismo.
  • Benchmarks em um Arc Pro B70 com Qwen3.6-27B mostram um aumento de 9,4% na taxa de transferência (de 920 para 1006 t/s).
  • A versão fornece binários para macOS, Linux, Windows, Android e openEuler através dos backends CPU, CUDA, Vulkan, ROCm, OpenVINO e SYCL.

Esta otimização melhora o desempenho de inferência em GPUs da Intel usando o backend SYCL.