O projeto llama.cpp lançou a compilação b10414, introduzindo suporte ao tipo de quantização ternária GGML_TYPE_TQ2_0 no backend Metal. Esta atualização também inclui otimizações no kernel mul_mv de tensores contíguos (cont).

  • Adicionado suporte a GGML_TYPE_TQ2_0 (ternário, 2 bits por elemento) ao backend Metal.
  • Otimizado o kernel mul_mv mudando de operações inteiras para operações de ponto flutuante.
  • Desempenho melhorado através de somas pré-calculadas, coeficientes elevados e carregamentos contíguos de y.

Esta versão fornece binários atualizados para macOS, Linux, Windows, Android e openEuler em vários backends de hardware incluindo CPU, CUDA, Vulkan, ROCm e SYCL.