O projeto llama.cpp lançou a versão b11122, que inclui atualizações significativas para o backend SYCL. O lançamento estende a fusão MMVQ GLU para suportar tipos de quantização mistos e introduz novas fusões para as operações rms_norm+scale e ssm_conv+silu.

  • Estende a fusão MMVQ GLU para lidar com tipos de quantização mistos no backend SYCL.
  • Adiciona fusões rms_norm+scale e ssm_conv+silu para SYCL.
  • Corrige problemas de espaçamento e converte uma macro para uma função modelo.
  • Fornece binários para macOS, Linux, Windows, Android e openEuler através de backends CPU, GPU e NPU incluindo CUDA, Vulkan, ROCm e OpenVINO.

Esta atualização melhora o desempenho e a compatibilidade para aceleração de hardware baseada em SYCL dentro do ecossistema llama.cpp.