Проект llama.cpp выпустил версию b10246, которая включает исправление производительности OpenCL для определенных конфигураций моделей. Обновление устраняет проблему, при которой исходное условие размерности было недостаточным для обработки больших весов.

  • Перенаправляет тензоры lm_head q6_K большого размера в плоский GEMV вместо gemv_noshuffle.
  • Добавляет прямое условие размера для предотвращения замедления работы с моделями вроде gemma-4 E2B, имеющими размерности [1536, 262144].
  • Предоставляет бинарные файлы для macOS (Apple Silicon и Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA, Vulkan, OpenVINO, SYCL, HIP) и openEuler.

Это изменение гарантирует эффективную обработку больших матриц весов на устройствах OpenCL без возникновения узких мест производительности.