O projeto llama.cpp lançou a versão b10891, que aborda um problema crítico de estabilidade em GPUs PowerVR. A atualização modifica o backend Vulkan para recuar à redução por memória compartilhada nas operações de multiplicação de matriz por vetor desquantizada (dmmv).

  • A alteração resolve uma falha causada pelo compilador proprietário Vulkan da Imagination ao retornar VK_ERROR_UNKNOWN ao criar pipelines de computação com reduções apenas por subgrupo.
  • Esta correção aplica-se aos formatos de quantização k-quants, i-quants, TQ2_0, MXFP4 e NVFP4 que anteriormente falhavam em dispositivos como o Pixel 11 Pro.
  • A variante de redução por memória compartilhada compila com sucesso e corresponde aos resultados de referência da CPU para as quantizações q2_K a q6_K.
  • Uma variante híbrida também está disponível, mas impõe uma penalidade significativa de desempenho, reduzindo a taxa de tokens processados para 27% da taxa padrão.

Esta atualização garante que modelos que utilizam esses formatos específicos de quantização possam ser executados em hardware PowerVR sem falhar durante a fase inicial de geração de tokens.