El proyecto llama.cpp lanzó la compilación b11266, que incluye una optimización de Vulkan que carga las matrices A de F32 dos elementos a la vez cuando están alineadas en 2. Este cambio aborda problemas de rendimiento en hardware de Intel donde cargar flotantes uno por uno es ineficiente, y también corrige una validación faltante para la alineación de `a_offset` en el parche original.
- La modificación aprovecha la lógica de carga 2-alineada existente en `mul_mat_vec` para mejorar el rendimiento en arquitecturas Intel BMG.
- Los resultados de benchmark en un Intel B60 muestran aceleraciones significativas para formas específicas de multiplicación de matrices, con un aumento del rendimiento de 153.08 GFLOPS a 221.66 GFLOPS para un caso de prueba y hasta 1.63 TFLOPS para otro.
- La versión proporciona binarios para macOS (Apple Silicon e Intel), Linux (CPU, Vulkan, CUDA, ROCm, OpenVINO, SYCL, Snapdragon), Android, Windows y openEuler.
Esta actualización mejora el rendimiento de inferencia en GPUs de Intel utilizando el backend de Vulkan optimizando los patrones de acceso a memoria para operaciones de matrices de punto flotante.