Проект llama.cpp выпустил версию b10830, внедряющую новую опцию командной строки для преобразования моделей. Это обновление добавляет флаг `--fuse-qkv`, который позволяет пользователям объединять матрицы Query, Key и Value в единую структуру QKV во время преобразования из формата Hugging Face в GGUF.
- В релиз включены бинарные файлы для macOS (Apple Silicon и Intel), Linux (Ubuntu с бэкендами CPU, Vulkan, ROCm, OpenVINO и SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, ROCm, OpenVINO и SYCL) и openEuler.
- Поддержка iOS предоставляется через XCFramework, в то время как поддержка KleidiAI на macOS Apple Silicon в настоящее время отключена.
Это обновление предоставляет пользователям более эффективный путь преобразования для моделей, которые выигрывают от объединенных механизмов внимания.