Проект llama.cpp выпустил версию b11035, добавившую поддержку ядер умножения матриц IQ3_S MMQ в бэкенде Vulkan.
- Обновление включает новые ядра IQ3_S MMQ matmul для Vulkan.
- Block_a_to_shmem теперь выполняет загрузку 2 байт для оптимизации доступа к памяти.
- Проверки выравнивания были скорректированы, поскольку IQ3_S использует размер тайла K.
- Бинарные файлы доступны для macOS, Linux, Windows, Android и openEuler на платформах CPU, CUDA, ROCm, OpenVINO, SYCL и OpenCL.
Это обновление предоставляет новые бинарные файлы для различных операционных систем и аппаратных ускорителей, позволяя пользователям использовать новую поддержку квантования Vulkan.