O projeto llama.cpp lançou a compilação b10414, introduzindo suporte ao tipo de quantização ternária GGML_TYPE_TQ2_0 no backend Metal. Esta atualização também inclui otimizações no kernel mul_mv de tensores contíguos (cont).
- Adicionado suporte a GGML_TYPE_TQ2_0 (ternário, 2 bits por elemento) ao backend Metal.
- Otimizado o kernel mul_mv mudando de operações inteiras para operações de ponto flutuante.
- Desempenho melhorado através de somas pré-calculadas, coeficientes elevados e carregamentos contíguos de y.
Esta versão fornece binários atualizados para macOS, Linux, Windows, Android e openEuler em vários backends de hardware incluindo CPU, CUDA, Vulkan, ROCm e SYCL.