Проект llama.cpp выпустил версию b10870, внедряющую поддержку Vulkan для конвейеров матричного умножения f16 B-типа и настройку размера тайла потока специально для оборудования Intel coopmat1.
- Добавлены конвейеры матричного умножения f16 B-типа и настройка размера тайла потока для Intel coopmat1.
- Включен конвейер f16 B-типа для плотного матричного умножения у всех поставщиков, при этом поддержка Mixture of Experts (MoE) оставлена только для Intel.
- Добавлены отсутствующие ветви OCP FP4 и ограничение required_subgroup_size применено к Intel.
- Упрощена и уточнена логика выбора mmp в mul_mat_id.
Это обновление расширяет совместимость Vulkan для определенных матричных операций и уточняет внутреннюю логику выбора для улучшения использования оборудования.