Проект llama.cpp выпустил сборку b11207, которая вводит поддержку операций GET_ROWS с тайлингом Q4_0 и Q8_0 на бэкенде Hexagon. Это обновление также включает исправления макросов, вытеснения регистров и конвейера DMA, а также улучшения логики выбора ядра и повторно включенную векторизацию.
- Добавлена поддержка GET_ROWS с тайлингом Q4_0 и Q8_0 для Hexagon с использованием тайлированного деквантования HVX.
- Исправлены макросы и вытеснение регистров в hex-get-rows при очистке проверок неподдерживаемых операций.
- Улучшен конвейер DMA и упрощена логика выбора ядра.
- Повторно включен векторизатор после того, как была выявлена регрессия во время обновления сэмплера.
Релиз предоставляет бинарные файлы для macOS, Linux, Windows, Android и openEuler для различных аппаратных бэкендов, включая CPU, GPU, NPU, CUDA, ROCm, Vulkan, OpenVINO и SYCL.