Проект llama.cpp выпустил версию 0.2.0, которая включает синхронизацию с библиотекой ggml, обновлённую до версии 0.21.0. Это обновление вносит несколько улучшений бэкенда и новых функций для различных аппаратных платформ.

  • Добавлена поддержка ядра Kleidiai SME2 F32 GEMV для повышения производительности на совместимом оборудовании.
  • Включена функция разделения тензоров для моделей LFM2 и LFM2MOE для улучшения распределения между несколькими GPU.
  • Реализована поддержка DSpark для моделей LFM2 в конвейере загрузки моделей.
  • Обновлён бэкенд SYCL с переупорядоченным Q2_K MMVQ, ядрами ESIMD и исправлениями для GPU Alchemist и проблем с mlock.
  • Улучшена стабильность OpenCL с исправлениями компиляторов Adreno A6x/A7x и расчётов локального размера.
  • Добавлен аргумент --mmproj-device для mtmd для указания размещения мультимодальных проекций.

Выпуск также включает очистку CI, улучшения навигации по настройкам интерфейса и различные исправления ошибок для бэкендов CUDA, Metal и Vulkan.