Проект llama.cpp выпустил сборку b10069, которая включает специфические обновления OpenCL для графических процессоров Qualcomm Adreno. Основное изменение заключается в поддержке операций широковещательной передачи для ядра Adreno MUL_MAT и учете смещений представления для варианта Q8_0 MUL_MAT, что позволяет включить многопоточную функциональность в llama-server.
- Добавлена поддержка широковещательной передачи для ядер GEMM/GEMV noshuffle Adreno.
- Обеспечено корректное обработку смещений представления для операций GEMM/GEMV noshuffle Adreno.
- Реализована общая поддержка широковещательной передачи GEMM/GEMV в бэкенде OpenCL.
- Удалены ненужные тесты и комментарии из кодовой базы.
Это обновление улучшает совместимость с многопоточными рабочими нагрузками на оборудовании Adreno, исправляя критические проблемы обработки ядер.