O projeto llama.cpp lançou a compilação b10883, que inclui atualizações significativas no backend Vulkan. A principal alteração envolve o uso de constantes de especificação para operações de multiplicação matriz-matriz tipo A para melhorar a compilação e o desempenho dos shaders.
- Usar constante de especificação para mul mat type_a nos shaders Vulkan.
- Consolidar tabelas de memória compartilhada e reduzir o tamanho por constante de especificação do tipo.
- Restaurar a otimização coopmat2 q4_k/q5_k e separar o shader para corrigir a regressão Ampere.
- Corrigir o tipo Q2_0 ausente na multiplicação de matrizes cm2 e adaptar as alterações de ajuste f16 da Intel.
- Contornar bug do compilador cm2 usando tamanho mínimo de memória compartilhada de 8.
Esta versão fornece binários atualizados para macOS, Linux, Windows, Android e openEuler em backends de CPU, GPU e hardware especializado.