Проект llama.cpp выпустил версию b10791, внедряя значительные оптимизации OpenCL для квантованных голов языковых моделей и операций декодирования GEMV. Это обновление также включает улучшения GEMM для средних пакетов, относящиеся к спекулятивному декодированию и предсказанию нескольких токенов.
- Оптимизирует opencl quant lm_head / decode GEMV и GEMM для средних пакетов для спекулятивного декодирования/MTP.
- Защищает регистрацию ядра преобразования tiled_ns q4_K/q6_K для сборок, не предназначенных для Adreno.
- Ограничивает диспетчеризацию слияния MUL_MAT+GLU q4_K конкретно оборудованием Adreno.
- Требует компоновки весов noshuffle в затворе слияния GLU q4_K.
- Предотвращает использование векторизованного пути GEMV f16 mrow при невыровненных шагах строк.
- Включает декодирование GEMV split-K q4_K только там, где измерены улучшения производительности.
- Ограничивает значения по умолчанию для tiled lm_head/embed GEMV архитектурами X2E/A8X.
Релиз предоставляет двоичные файлы для macOS, iOS, Linux, Windows, Android и openEuler для CPU, GPU и различных бэкендов ускорителей.