O lançamento llama.cpp b10614 introduz uma mudança arquitetural significativa no backend do Metal ao dividir as fontes das operações e habilitar a compilação paralela. Esta atualização também inclui várias implementações de kernel novas e suporte para formatos de quantização adicionais.

  • Dividir metallib em 8 bibliotecas e carregá-las em paralelo para melhorar os tempos de build.
  • Adicionar operação col2im_1d suportando tipos de dados f32, f16 e bf16.
  • Implementar suporte CONV_2D_DW (convolução profunda) para Metal.
  • Adicionar suporte ao formato de quantização Q2_0.
  • Fundir operações de ativação snake (mul, sin, sqr, mul, add).
  • Introduzir kernel FWHT para o backend do Metal.

Este lançamento fornece binários pré-compilados para macOS, iOS, Linux, Windows, Android e openEuler através de CPU, GPU e vários backends de aceleradores.