O projeto llama.cpp lançou a compilação b11059, que introduz atualizações significativas para o backend Metal em hardware Apple Silicon. A principal alteração é a adição de suporte a entrada F16 ao kernel Fast Walsh-Hadamard Transform (FWHT), permitindo que ele leia fontes F16 diretamente sem exigir uma cópia convertida.
- O kernel FWHT do Metal agora aceita entrada F16 tornando o tipo de fonte um parâmetro de modelo, enquanto as instanciações F32 permanecem inalteradas.
- Uma seleção borboleta sem ramificação no kernel SIMD do grupo FWHT substitui operadores ternários, resultando em um ganho de desempenho de 3,0% (1285,0 us vs 1324,6 us) em um M5 Pro para grandes matmuls de Hadamard.
- Os predicados de despacho foram movidos para ggml-metal-common para corrigir a compilação macos-latest-arm64 e garantir consistência entre supports_op e a lógica de despacho.
- A versão inclui binários para macOS, iOS, Linux, Windows, Android e openEuler nos backends CPU, CUDA, ROCm, Vulkan, OpenVINO e SYCL.
Esta atualização melhora a eficiência no Apple Silicon ao reduzir a sobrecarga de memória e a latência para operações F16 no backend Metal.