O projeto llama.cpp lançou a versão b10726, que introduz otimizações significativas de desempenho para processar tamanhos de lote grandes em modelos quantizados IQ. A atualização principal aproveita as instruções AVX2 para acelerar os quants IQ de grade por meio de operações GEMM em lote.

  • Implementação de GEMM em lote para quants IQ de grade
  • Vetorização da decodificação de painéis IQ com um limiar reduzido para aceleração
  • Introdução do kernel ggml_gemm_iqp_8x8_q8_K_p4 e remoção do buffer gather
  • Layout de gather de fonte única, viés de gate e entrelaçamento vetorizado para painéis IQ
  • Adição de suporte a fallback NUMA e testes de lote de 10 linhas para cobertura IQP

Este lançamento fornece capacidades de inferência mais rápidas para usuários executando modelos IQ em hardware compatível.