O projeto llama.cpp lançou a compilação b10777, que inclui otimizações para o backend SYCL na multiplicação matriz-vetor (MMVQ) de múltiplas colunas com Q4_K. A atualização foca em reduzir trabalho computacional redundante por meio de estratégias de descompactação de pesos e reutilização de ativações.

  • Otimiza a descompactação de pesos Q4_K e reutiliza dados entre colunas de destino.
  • Implementa reutilização de subgrupos de ativações para valores pequenos de N (N=2..4) em duas linhas de saída.
  • Limita o padrão de reutilização de duas linhas especificamente para N=2 para melhorar a eficiência.
  • Atualiza o limite do número mágico para Q4_K_MMVQ_ROW_PAIR_MIN_NROWS=6272 e adiciona testes de desempenho para cobertura MUL_MAT com Q4_K.

Este lançamento fornece binários pré-compilados para macOS, Linux, Android, Windows e openEuler em vários backends de hardware, incluindo CPU, CUDA, ROCm, Vulkan, OpenVINO e SYCL.