O projeto llama.cpp lançou a versão 0.2.0, que inclui uma sincronização com a biblioteca ggml atualizada para a versão 0.21.0. Esta atualização introduz várias melhorias de backend e novos recursos em diversas plataformas de hardware.
- Adicionado suporte ao kernel Kleidiai SME2 F32 GEMV para desempenho aprimorado em hardware compatível.
- Ativada a funcionalidade de divisão de tensor para os modelos LFM2 e LFM2MOE para melhorar a distribuição entre múltiplas GPUs.
- Implementado o suporte DSpark para os modelos LFM2 dentro do pipeline de carregamento de modelos.
- Backend SYCL atualizado com MMVQ Q2_K reordenado, kernels ESIMD e correções para GPUs Alchemist e problemas de mlock.
- Estabilidade do OpenCL aprimorada com correções para compiladores Adreno A6x/A7x e cálculos de tamanho local.
- Adicionado o argumento --mmproj-device ao mtmd para especificar a localização do dispositivo das projeções multimodais.
O lançamento também inclui limpezas no CI, melhorias na navegação das configurações da UI e várias correções de bugs nos backends CUDA, Metal e Vulkan.