O lançamento llama.cpp b10614 introduz uma mudança arquitetural significativa no backend do Metal ao dividir as fontes das operações e habilitar a compilação paralela. Esta atualização também inclui várias implementações de kernel novas e suporte para formatos de quantização adicionais.
- Dividir metallib em 8 bibliotecas e carregá-las em paralelo para melhorar os tempos de build.
- Adicionar operação col2im_1d suportando tipos de dados f32, f16 e bf16.
- Implementar suporte CONV_2D_DW (convolução profunda) para Metal.
- Adicionar suporte ao formato de quantização Q2_0.
- Fundir operações de ativação snake (mul, sin, sqr, mul, add).
- Introduzir kernel FWHT para o backend do Metal.
Este lançamento fornece binários pré-compilados para macOS, iOS, Linux, Windows, Android e openEuler através de CPU, GPU e vários backends de aceleradores.