El proyecto llama.cpp lanzó la versión b10726, que introduce optimizaciones significativas de rendimiento para procesar tamaños de lote grandes en modelos cuantizados IQ. La actualización principal aprovecha las instrucciones AVX2 para acelerar los cuantizados IQ de cuadrícula a través de operaciones GEMM por lotes.
- Implementación de GEMM por lotes para cuantizados IQ de cuadrícula
- Vectorización de la decodificación de paneles IQ con un umbral reducido para aceleración
- Introducción del kernel ggml_gemm_iqp_8x8_q8_K_p4 y eliminación del búfer gather
- Disposición de gather de fuente única, sesgo de puerta y entrelazado vectorizado para paneles IQ
- Adición de soporte de respaldo NUMA y pruebas de lotes de 10 filas para cobertura IQP
Esta versión proporciona capacidades de inferencia más rápidas para usuarios que ejecutan modelos IQ en hardware compatible.