O projeto llama.cpp lançou a versão b10456, que inclui uma correção crítica para o backend SYCL nos lançamentos do kernel de cópia quantizada. A atualização ajusta as contagens de threads e blocos para serem proporcionais ao tamanho da quantização, reduzindo efetivamente os problemas de sub- e super-reserva.

  • Corrige a contagem de threads/blocos nos lançamentos do kernel cpy quantizado (PR #27160).
  • A taxa de transferência para o caminho q4_0 -> f32 em um Arc 70 aumenta de 20,21 GB/s para 158,19 GB/s.
  • Outros caminhos de quantização mostram aumentos planos de desempenho.
  • Os binários estão disponíveis para macOS, Linux, Windows, Android e openEuler nos backends CPU, CUDA, Vulkan, ROCm, OpenVINO e SYCL.

Esta alteração melhora significativamente a eficiência da transferência de dados em GPUs Intel Arc usando o backend SYCL, abordando um grande gargalo de desempenho nas operações quantizadas.