El proyecto llama.cpp lanzó la compilación b10757, que incluye una optimización específica para el backend de Vulkan. Esta actualización maneja de manera eficiente tamaños de lote mayores a 4 para la multiplicación matriz-vector IQ3_S cuando NUM_COLS es mayor que 4.

  • Logra una mejora de rendimiento de 5x en n=8 para la configuración mat-vec IQ3_S de Vulkan especificada.
  • Añade dos casos por tipo de cuantización en k=16*256 al barrido mat-vec all_types.
  • Proporciona binarios para macOS (Apple Silicon e Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, OpenCL, Vulkan, OpenVINO, SYCL, ROCm) y openEuler.

Este lanzamiento permite a los usuarios ejecutar llama.cpp en una amplia variedad de plataformas de hardware con optimizaciones de Vulkan actualizadas para tipos de cuantización específicos.