O projeto llama.cpp lançou a versão b10726, que introduz otimizações significativas de desempenho para processar tamanhos de lote grandes em modelos quantizados IQ. A atualização principal aproveita as instruções AVX2 para acelerar os quants IQ de grade por meio de operações GEMM em lote.
- Implementação de GEMM em lote para quants IQ de grade
- Vetorização da decodificação de painéis IQ com um limiar reduzido para aceleração
- Introdução do kernel ggml_gemm_iqp_8x8_q8_K_p4 e remoção do buffer gather
- Layout de gather de fonte única, viés de gate e entrelaçamento vetorizado para painéis IQ
- Adição de suporte a fallback NUMA e testes de lote de 10 linhas para cobertura IQP
Este lançamento fornece capacidades de inferência mais rápidas para usuários executando modelos IQ em hardware compatível.