Проект llama.cpp выпустил сборку b10757, которая включает специфическую оптимизацию для бэкенда Vulkan. Это обновление эффективно обрабатывает большие размеры батча более 4 для умножения матрицы на вектор IQ3_S, когда NUM_COLS больше 4.

  • Достигается улучшение производительности в 5 раз при n=8 для указанной конфигурации mat-vec IQ3_S Vulkan.
  • Добавляются два случая для каждого типа квантования при k=16*256 в общий проход mat-vec all_types.
  • Предоставляются бинарные файлы для macOS (Apple Silicon и Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, OpenCL, Vulkan, OpenVINO, SYCL, ROCm) и openEuler.

Это обновление позволяет пользователям запускать llama.cpp на широком спектре аппаратных платформ с обновленными оптимизациями Vulkan для конкретных типов квантования.