Проект llama.cpp выпустил версию b10830, внедряющую новую опцию командной строки для преобразования моделей. Это обновление добавляет флаг `--fuse-qkv`, который позволяет пользователям объединять матрицы Query, Key и Value в единую структуру QKV во время преобразования из формата Hugging Face в GGUF.

  • В релиз включены бинарные файлы для macOS (Apple Silicon и Intel), Linux (Ubuntu с бэкендами CPU, Vulkan, ROCm, OpenVINO и SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, ROCm, OpenVINO и SYCL) и openEuler.
  • Поддержка iOS предоставляется через XCFramework, в то время как поддержка KleidiAI на macOS Apple Silicon в настоящее время отключена.

Это обновление предоставляет пользователям более эффективный путь преобразования для моделей, которые выигрывают от объединенных механизмов внимания.