O lançamento llama.cpp b10831 introduz suporte à quantização TQ1_0 para o backend Vulkan, permitindo operações como multiplicação de matrizes, mat-vec, desquantização e get_rows. Esta atualização também corrige o backend Metal para recusar adequadamente as operações TQ1_0 não suportadas, garantindo que elas retornem à execução na CPU.

  • A implementação do Vulkan agrupa potências de 3 do TQ1_0 em uma constante de 32 bits para evitar problemas de registrador.
  • Auxiliares compartilhados de decodificação em types.glsl substituem a lógica duplicada em vários arquivos de shader.
  • Um bug no cálculo do denominador do workgroup do shader standalone de desquantização foi corrigido.
  • O backend Metal agora rejeita TQ1_0 para GET_ROWS e mat-mul, correspondendo ao tratamento existente do NVFP4.
  • Casos de teste foram reduzidos e os comentários padronizados para ASCII.

As alterações do Vulkan foram verificadas na AMD gfx1151 com todas as operações relevantes do backend passando nos testes.