Проект llama.cpp выпустил версию b10900, которая содержит техническое обновление бэкенда Vulkan. Этот релиз добавляет зависимость выделения памяти специально для включения оптимизации слияния topk_moe на фазе префилла.

  • Основное изменение кода — добавление зависимости выделения памяти в реализацию Vulkan для поддержки слияния topk_moe для операций префилла.
  • Бинарные файлы предоставлены для macOS (Apple Silicon и Intel), Linux (CPU, Vulkan, ROCm 10.0, OpenVINO, SYCL), Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm 10.0), Android и iOS.
  • Поддержка KleidiAI для macOS Apple Silicon отключена в этой сборке.

Это обновление предоставляет пользователям оптимизированную производительность префилла на оборудовании, совместимом с Vulkan, благодаря новой включенной технике слияния.