O projeto llama.cpp lançou a versão b10870, introduzindo suporte Vulkan para pipelines de multiplicação matricial f16 tipo B e ajuste do tamanho do tile warp especificamente para hardware Intel coopmat1.
- Adicionados pipelines de multiplicação matricial f16 tipo B e ajuste do tamanho do tile warp para Intel coopmat1.
- Ativado o pipeline f16 tipo B para multiplicação matricial densa em todos os fornecedores, mantendo o suporte Mixture of Experts (MoE) apenas para Intel.
- Adicionados os ramos OCP FP4 ausentes e restringido required_subgroup_size à Intel.
- Simplificado e refinado a seleção de mmp no mul_mat_id.
Esta atualização expande a compatibilidade Vulkan para operações matriciais específicas e refina a lógica interna de seleção para melhorar a utilização do hardware.