O projeto llama.cpp lançou a versão b11195, introduzindo uma implementação de multiplicação matricial em blocos para k-quants no backend da CPU. Essa alteração descompacta os dados quantizados em tiles int8 de 256x256 e computa os resultados usando microkernels para melhorar o desempenho em operações com matrizes grandes.
- mul_mat em blocos fornece uma aceleração de 3 a 6x para multiplicações matriciais grandes, com ponto de equilíbrio nas dimensões 4096x64 * 64x4096.
- As taxas de erro permanecem insignificantes, com erros máximos em torno de 1-e04 e RMSE em torno de 1-e05.
- A atualização inclui correções para compilações ARM e Windows, suporte unificado ao IQP para benchmarks Q5_K e IQ4_XS, e kernels AVX2 otimizados.
A atualização melhora a velocidade de inferência para operações com matrizes grandes enquanto mantém a precisão numérica nas plataformas suportadas.