O projeto llama.cpp lançou a versão b10723, que inclui otimizações específicas para OpenCL em hardware gráfico Intel Xe-LP. A atualização foca em melhorar o desempenho de geração de tensores (TG) e pré-preenchimento (PP) ajustando os kernels de quantização.
- Operações mul_mv Q4_K e Q5_K foram ajustadas para aumentar os valores N_DST, permitindo reuso 2x de ativações em dispositivos Intel.
- Configurações de tiles 8x8 foram implementadas para as operações mul_mm Q4_K e Q5_K especificamente para arquiteturas Intel.
- O N_DST foi aumentado de 8 para 16 para mul_mv Q4_K para otimizar ainda mais o manuseio de dados.
Este lançamento fornece binários atualizados para macOS, Linux, Windows, Android e iOS em vários backends incluindo CUDA, Vulkan, ROCm e SYCL.