Проект llama.cpp выпустил версию b11035, добавившую поддержку ядер умножения матриц IQ3_S MMQ в бэкенде Vulkan.

  • Обновление включает новые ядра IQ3_S MMQ matmul для Vulkan.
  • Block_a_to_shmem теперь выполняет загрузку 2 байт для оптимизации доступа к памяти.
  • Проверки выравнивания были скорректированы, поскольку IQ3_S использует размер тайла K.
  • Бинарные файлы доступны для macOS, Linux, Windows, Android и openEuler на платформах CPU, CUDA, ROCm, OpenVINO, SYCL и OpenCL.

Это обновление предоставляет новые бинарные файлы для различных операционных систем и аппаратных ускорителей, позволяя пользователям использовать новую поддержку квантования Vulkan.