Проект llama.cpp выпустил версию b10870, внедряющую поддержку Vulkan для конвейеров матричного умножения f16 B-типа и настройку размера тайла потока специально для оборудования Intel coopmat1.

  • Добавлены конвейеры матричного умножения f16 B-типа и настройка размера тайла потока для Intel coopmat1.
  • Включен конвейер f16 B-типа для плотного матричного умножения у всех поставщиков, при этом поддержка Mixture of Experts (MoE) оставлена только для Intel.
  • Добавлены отсутствующие ветви OCP FP4 и ограничение required_subgroup_size применено к Intel.
  • Упрощена и уточнена логика выбора mmp в mul_mat_id.

Это обновление расширяет совместимость Vulkan для определенных матричных операций и уточняет внутреннюю логику выбора для улучшения использования оборудования.