Проект llama.cpp выпустил сборку b10414, добавляющую поддержку типа тернарной квантования GGML_TYPE_TQ2_0 в бэкенде Metal. Это обновление также включает оптимизации ядра mul_mv для непрерывных тензоров (cont).
- Добавлена поддержка GGML_TYPE_TQ2_0 (тернарная, 2 бита на элемент) в бэкенде Metal.
- Оптимизировано ядро mul_mv путем переключения с целочисленных операций на операции с плавающей запятой.
- Улучшена производительность за счет предварительно вычисленных сумм, вынесенных коэффициентов и непрерывной загрузки y.
Этот релиз предоставляет обновленные бинарные файлы для macOS, Linux, Windows, Android и openEuler для различных аппаратных бэкендов, включая CPU, CUDA, Vulkan, ROCm и SYCL.