El proyecto llama.cpp ha lanzado la versión 0.2.0, que incluye una sincronización con la biblioteca ggml actualizada a la versión 0.21.0. Esta actualización introduce varias mejoras en los backends y nuevas características en diversas plataformas de hardware.
- Se añadió soporte para el kernel Kleidiai SME2 F32 GEMV para mejorar el rendimiento en hardware compatible.
- Se habilitó la funcionalidad de división de tensores para los modelos LFM2 y LFM2MOE para mejorar la distribución en múltiples GPUs.
- Se implementó el soporte DSpark para los modelos LFM2 dentro del proceso de carga del modelo.
- Se actualizó el backend SYCL con MMVQ Q2_K reordenado, kernels ESIMD y correcciones para las GPUs Alchemist y problemas de mlock.
- Se mejoró la estabilidad de OpenCL con correcciones para los compiladores Adreno A6x/A7x y los cálculos del tamaño local.
- Se añadió el argumento --mmproj-device a mtmd para especificar la ubicación del dispositivo de las proyecciones multimodales.
El lanzamiento también incluye limpiezas de CI, mejoras en la navegación de la configuración de la interfaz de usuario y varias correcciones de errores para los backends CUDA, Metal y Vulkan.