O projeto llama.cpp lançou a compilação b10673, que inclui otimizações específicas de desempenho para hardware Apple M4. Esta atualização introduz registros fa_vec_tuned_table no módulo ggml-metal-tuning para melhorar a eficiência do backend Metal.

  • Adiciona tabelas de consulta ajustadas para quantizações F16, Q4_0, Q4_1, Q5_0, Q5_1 e Q8_0 em chips M4 com 10 núcleos GPU.
  • Fornece binários para macOS Apple Silicon (arm64), macOS Intel (x64) e iOS XCFramework.
  • Inclui compilações para Linux para Ubuntu x64 e arm64 nos backends CPU, Vulkan, ROCm 7.14, OpenVINO e SYCL.
  • Oferece binários para Windows para CPU, OpenCL Adreno, CUDA 12/13, Vulkan, OpenVINO, SYCL e ROCm 7.14.
  • Adiciona suporte para Android arm64 (CPU) e binários de interface do usuário.

Este lançamento garante que usuários em dispositivos Apple M4 possam aproveitar kernels Metal otimizados para inferência mais rápida.