Проект llama.cpp выпустил версию b10723, которая включает специфические оптимизации для OpenCL на графическом оборудовании Intel Xe-LP. Обновление сосредоточено на улучшении производительности генерации тензоров (TG) и префиллинга (PP) за счет настройки ядер квантования.
- Настроены операции mul_mv Q4_K и Q5_K для увеличения значений N_DST, что обеспечивает 2x повторное использование активаций на устройствах Intel.
- Реализованы конфигурации тайлов 8x8 как для операций mul_mm Q4_K, так и Q5_K специально для архитектур Intel.
- Увеличено значение N_DST с 8 до 16 для mul_mv Q4_K для дальнейшей оптимизации обработки данных.
Этот релиз предоставляет обновленные бинарные файлы для macOS, Linux, Windows, Android и iOS в различных бэкендах, включая CUDA, Vulkan, ROCm и SYCL.