Релиз llama.cpp b11413 представляет новую реализацию разреженного flash-внимания на базе Vulkan, поддерживающую квантованные тензоры ключей и значений. Это обновление решает проблемы производительности в предыдущем методе компактификации, который был слишком затратным для задач декодирования с большими контекстными окнами.

  • Новый подход разделяет строки на непрерывные сегменты, обрабатываемые подгруппами или потоками, используя подсчет голосований по объединенным загрузкам для поддержания списка индексов в возрастающем порядке.
  • Предварительно собранные бинарные файлы доступны для macOS (Apple Silicon и Intel), Linux (CPU, Vulkan, CUDA 12/13, ROCm, OpenVINO, SYCL, Snapdragon), Windows (CPU, Vulkan, CUDA, OpenVINO, SYCL, ROCm), Android и iOS.
  • В релиз также входят интерфейс пользователя llama.cpp и аттестации для проверки безопасности.