Проект llama.cpp выпустил версию b10791, внедряя значительные оптимизации OpenCL для квантованных голов языковых моделей и операций декодирования GEMV. Это обновление также включает улучшения GEMM для средних пакетов, относящиеся к спекулятивному декодированию и предсказанию нескольких токенов.

  • Оптимизирует opencl quant lm_head / decode GEMV и GEMM для средних пакетов для спекулятивного декодирования/MTP.
  • Защищает регистрацию ядра преобразования tiled_ns q4_K/q6_K для сборок, не предназначенных для Adreno.
  • Ограничивает диспетчеризацию слияния MUL_MAT+GLU q4_K конкретно оборудованием Adreno.
  • Требует компоновки весов noshuffle в затворе слияния GLU q4_K.
  • Предотвращает использование векторизованного пути GEMV f16 mrow при невыровненных шагах строк.
  • Включает декодирование GEMV split-K q4_K только там, где измерены улучшения производительности.
  • Ограничивает значения по умолчанию для tiled lm_head/embed GEMV архитектурами X2E/A8X.

Релиз предоставляет двоичные файлы для macOS, iOS, Linux, Windows, Android и openEuler для CPU, GPU и различных бэкендов ускорителей.