O lançamento llama.cpp b11265 inclui uma correção para o tratamento de modelos Mixture of Experts (MoE) pelo backend do Vulkan. A atualização corrige como `mat_mul_id` seleciona os tiles de multiplicação de matrizes, abordando um problema de desempenho onde os workers ficavam ociosos durante o despacho.

  • Anteriormente, a seleção de tiles dependia da contagem total de tokens, o que estava incorreto para grades de despacho MoE onde o N real por grupo de trabalho são linhas por especialista.
  • Em modelos como Sarvam 30B com pp128, esse erro fazia com que o seletor escolhesse tiles para aproximadamente 6 linhas ativas em vez de 128.
  • A correção garante que todos os workers em um grupo tenham trabalho a fazer, eliminando o tempo desperdiçado que anteriormente representava 55% da duração do trabalho.

Esta alteração melhora a eficiência de inferência para modelos MoE no Vulkan ao garantir uma distribuição adequada da carga de trabalho entre os workers da GPU.