O projeto llama.cpp lançou a versão b10816, que inclui atualizações para o backend Metal em dispositivos Apple Silicon. O lançamento foca em adicionar os ajustes restantes de fast-vector especificamente para a arquitetura do chip M3.

  • Adiciona entradas M3 à fa_vec_tuned_table.
  • Inclui as quantizações q4_0, q4_1, q5_0 e q5_1 no ggml-metal-tuning.
  • Fornece binários para macOS (Apple Silicon e Intel), iOS, Linux, Windows, Android e openEuler.
  • Suporta vários backends incluindo CPU, Vulkan, ROCm 10.0, OpenVINO, SYCL, CUDA 12/13 e OpenCL Adreno.

Esta atualização garante desempenho otimizado para hardware M3 enquanto expande a disponibilidade de binários pré-compilados em múltiplos sistemas operacionais e arquiteturas de GPU.