Проект llama.cpp выпустил версию 0.2.0, которая включает синхронизацию с библиотекой ggml, обновлённую до версии 0.21.0. Это обновление вносит несколько улучшений бэкенда и новых функций для различных аппаратных платформ.
- Добавлена поддержка ядра Kleidiai SME2 F32 GEMV для повышения производительности на совместимом оборудовании.
- Включена функция разделения тензоров для моделей LFM2 и LFM2MOE для улучшения распределения между несколькими GPU.
- Реализована поддержка DSpark для моделей LFM2 в конвейере загрузки моделей.
- Обновлён бэкенд SYCL с переупорядоченным Q2_K MMVQ, ядрами ESIMD и исправлениями для GPU Alchemist и проблем с mlock.
- Улучшена стабильность OpenCL с исправлениями компиляторов Adreno A6x/A7x и расчётов локального размера.
- Добавлен аргумент --mmproj-device для mtmd для указания размещения мультимодальных проекций.
Выпуск также включает очистку CI, улучшения навигации по настройкам интерфейса и различные исправления ошибок для бэкендов CUDA, Metal и Vulkan.