El proyecto llama.cpp ha lanzado la versión 0.2.0, que incluye una sincronización con la biblioteca ggml actualizada a la versión 0.21.0. Esta actualización introduce varias mejoras en los backends y nuevas características en diversas plataformas de hardware.

  • Se añadió soporte para el kernel Kleidiai SME2 F32 GEMV para mejorar el rendimiento en hardware compatible.
  • Se habilitó la funcionalidad de división de tensores para los modelos LFM2 y LFM2MOE para mejorar la distribución en múltiples GPUs.
  • Se implementó el soporte DSpark para los modelos LFM2 dentro del proceso de carga del modelo.
  • Se actualizó el backend SYCL con MMVQ Q2_K reordenado, kernels ESIMD y correcciones para las GPUs Alchemist y problemas de mlock.
  • Se mejoró la estabilidad de OpenCL con correcciones para los compiladores Adreno A6x/A7x y los cálculos del tamaño local.
  • Se añadió el argumento --mmproj-device a mtmd para especificar la ubicación del dispositivo de las proyecciones multimodales.

El lanzamiento también incluye limpiezas de CI, mejoras en la navegación de la configuración de la interfaz de usuario y varias correcciones de errores para los backends CUDA, Metal y Vulkan.