Проект llama.cpp выпустил сборку b10069, которая включает специфические обновления OpenCL для графических процессоров Qualcomm Adreno. Основное изменение заключается в поддержке операций широковещательной передачи для ядра Adreno MUL_MAT и учете смещений представления для варианта Q8_0 MUL_MAT, что позволяет включить многопоточную функциональность в llama-server.

  • Добавлена поддержка широковещательной передачи для ядер GEMM/GEMV noshuffle Adreno.
  • Обеспечено корректное обработку смещений представления для операций GEMM/GEMV noshuffle Adreno.
  • Реализована общая поддержка широковещательной передачи GEMM/GEMV в бэкенде OpenCL.
  • Удалены ненужные тесты и комментарии из кодовой базы.

Это обновление улучшает совместимость с многопоточными рабочими нагрузками на оборудовании Adreno, исправляя критические проблемы обработки ядер.