El proyecto llama.cpp ha lanzado la versión b10830, introduciendo una nueva opción de línea de comandos para la conversión de modelos. Esta actualización añade la bandera `--fuse-qkv`, que permite a los usuarios fusionar las matrices de Query, Key y Value en una única estructura QKV durante la conversión desde el formato Hugging Face a GGUF.

  • El lanzamiento incluye binarios para macOS (Apple Silicon e Intel), Linux (Ubuntu con backends de CPU, Vulkan, ROCm, OpenVINO y SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, ROCm, OpenVINO y SYCL) y openEuler.
  • El soporte para iOS se proporciona a través de un XCFramework, mientras que el soporte de KleidiAI en macOS Apple Silicon está actualmente deshabilitado.

Esta actualización ofrece a los usuarios una ruta de conversión más eficiente para modelos que se benefician de mecanismos de atención fusionados.