O projeto llama.cpp lançou a versão b10791, introduzindo otimizações significativas do OpenCL para cabeças de modelos de linguagem quantizadas e operações de GEMV de decodificação. Esta atualização também inclui melhorias de GEMM em lotes médios relevantes para decodificação especulativa e previsão de múltiplos tokens.
- Otimiza opencl quant lm_head / decode GEMV e GEMM em lotes médios para decodificação especulativa/MTP.
- Protege o registro do kernel de conversão tiled_ns q4_K/q6_K para compilações não Adreno.
- Direciona a fusão MUL_MAT+GLU q4_K especificamente para hardware Adreno.
- Requer o layout de peso noshuffle na porta de fusão GLU q4_K.
- Impede o uso do caminho GEMV mrow f16 vetorizado em strides de linha não alinhados.
- Habilita o decode GEMV split-K q4_K apenas onde os ganhos de desempenho foram medidos.
- Restringe os padrões de GEMV tiled lm_head/embed às arquiteturas X2E/A8X.
O lançamento fornece binários para macOS, iOS, Linux, Windows, Android e openEuler em CPUs, GPUs e vários backends de acelerador.