O projeto llama.cpp lançou a compilação b10757, que inclui uma otimização específica para o backend do Vulkan. Esta atualização lida eficientemente com tamanhos de lote maiores que 4 para multiplicação matriz-vetor IQ3_S quando NUM_COLS é maior que 4.
- Alcança uma melhoria de desempenho de 5x em n=8 para a configuração mat-vec IQ3_S do Vulkan especificada.
- Adiciona dois casos por tipo de quantização em k=16*256 à varredura mat-vec all_types.
- Fornece binários para macOS (Apple Silicon e Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, OpenCL, Vulkan, OpenVINO, SYCL, ROCm) e openEuler.
Este lançamento permite que os usuários executem o llama.cpp em uma ampla variedade de plataformas de hardware com otimizações de Vulkan atualizadas para tipos de quantização específicos.