Проект llama.cpp выпустил сборку b10754, которая включает критическое исправление для OpenCL на GPU Adreno для предотвращения чтения памяти за пределами допустимых границ в ядрах обработки изображений.
- Выборка строки декодирования q4_K GEMV теперь ограничена на дополненной x-сетке.
- Контракт тайлинга для GEMM KQ/KQV изображений строго соблюдается.
- Логика разделения для изображения KQ/KQV определяется во время диспетчеризации, а не полагается на шаги (strides).
Это обновление обеспечивает стабильность и корректность для пользователей, запускающих llama.cpp с ускорением OpenCL на оборудовании Adreno.