O projeto llama.cpp lançou a versão b10816, que inclui atualizações para o backend Metal em dispositivos Apple Silicon. O lançamento foca em adicionar os ajustes restantes de fast-vector especificamente para a arquitetura do chip M3.
- Adiciona entradas M3 à fa_vec_tuned_table.
- Inclui as quantizações q4_0, q4_1, q5_0 e q5_1 no ggml-metal-tuning.
- Fornece binários para macOS (Apple Silicon e Intel), iOS, Linux, Windows, Android e openEuler.
- Suporta vários backends incluindo CPU, Vulkan, ROCm 10.0, OpenVINO, SYCL, CUDA 12/13 e OpenCL Adreno.
Esta atualização garante desempenho otimizado para hardware M3 enquanto expande a disponibilidade de binários pré-compilados em múltiplos sistemas operacionais e arquiteturas de GPU.