Проект llama.cpp выпустил сборку b10754, которая включает критическое исправление для OpenCL на GPU Adreno для предотвращения чтения памяти за пределами допустимых границ в ядрах обработки изображений.

  • Выборка строки декодирования q4_K GEMV теперь ограничена на дополненной x-сетке.
  • Контракт тайлинга для GEMM KQ/KQV изображений строго соблюдается.
  • Логика разделения для изображения KQ/KQV определяется во время диспетчеризации, а не полагается на шаги (strides).

Это обновление обеспечивает стабильность и корректность для пользователей, запускающих llama.cpp с ускорением OpenCL на оборудовании Adreno.