O projeto llama.cpp lançou a compilação b10883, que inclui atualizações significativas no backend Vulkan. A principal alteração envolve o uso de constantes de especificação para operações de multiplicação matriz-matriz tipo A para melhorar a compilação e o desempenho dos shaders.

  • Usar constante de especificação para mul mat type_a nos shaders Vulkan.
  • Consolidar tabelas de memória compartilhada e reduzir o tamanho por constante de especificação do tipo.
  • Restaurar a otimização coopmat2 q4_k/q5_k e separar o shader para corrigir a regressão Ampere.
  • Corrigir o tipo Q2_0 ausente na multiplicação de matrizes cm2 e adaptar as alterações de ajuste f16 da Intel.
  • Contornar bug do compilador cm2 usando tamanho mínimo de memória compartilhada de 8.

Esta versão fornece binários atualizados para macOS, Linux, Windows, Android e openEuler em backends de CPU, GPU e hardware especializado.