O projeto llama.cpp lançou a versão b10870, introduzindo suporte Vulkan para pipelines de multiplicação matricial f16 tipo B e ajuste do tamanho do tile warp especificamente para hardware Intel coopmat1.

  • Adicionados pipelines de multiplicação matricial f16 tipo B e ajuste do tamanho do tile warp para Intel coopmat1.
  • Ativado o pipeline f16 tipo B para multiplicação matricial densa em todos os fornecedores, mantendo o suporte Mixture of Experts (MoE) apenas para Intel.
  • Adicionados os ramos OCP FP4 ausentes e restringido required_subgroup_size à Intel.
  • Simplificado e refinado a seleção de mmp no mul_mat_id.

Esta atualização expande a compatibilidade Vulkan para operações matriciais específicas e refina a lógica interna de seleção para melhorar a utilização do hardware.