Проект llama.cpp выпустил версию b10657, вводя новые бинарные ядра OpenCL для моделей с смешанными экспертами. В частности, обновление добавляет `kernel_gemm_moe_q4_0_q8_1_dp4a_bin` и `kernel_gemm_moe_mxfp4_q8_1_dp4a_bin` для поддержки эффективных вычислений на совместимом оборудовании.

  • Добавлены бинарные ядра OpenCL для GEMO MOE с квантованиями q4_0/q8_1 и mxfp4/q8_1.
  • Предоставлены двоичные файлы для macOS (Apple Silicon и Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm), Android и openEuler.
  • Поддержка KleidiAI на Apple Silicon в macOS остается отключенной в этом выпуске.

Это обновление расширяет совместимость оборудования для моделей с смешанными экспертами за счет включения конкретных реализаций ядер OpenCL.