O projeto llama.cpp lançou a versão b10830, introduzindo uma nova opção de linha de comando para conversão de modelos. Esta atualização adiciona a flag `--fuse-qkv`, que permite aos usuários fundir as matrizes Query, Key e Value em uma única estrutura QKV durante a conversão do formato Hugging Face para GGUF.

  • O lançamento inclui binários para macOS (Apple Silicon e Intel), Linux (Ubuntu com backends de CPU, Vulkan, ROCm, OpenVINO e SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, ROCm, OpenVINO e SYCL) e openEuler.
  • O suporte para iOS é fornecido via XCFramework, enquanto o suporte do KleidiAI no macOS Apple Silicon está atualmente desabilitado.

Esta atualização oferece aos usuários um caminho de conversão mais eficiente para modelos que se beneficiam de mecanismos de atenção fundidos.