El proyecto llama.cpp ha lanzado la versión b10816, que incluye actualizaciones al backend Metal para dispositivos Apple Silicon. El lanzamiento se centra en añadir los ajustes restantes de fast-vector específicamente para la arquitectura del chip M3.
- Añade entradas M3 a fa_vec_tuned_table.
- Incluye las cuantizaciones q4_0, q4_1, q5_0 y q5_1 en ggml-metal-tuning.
- Proporciona binarios para macOS (Apple Silicon e Intel), iOS, Linux, Windows, Android y openEuler.
- Soporta varios backends incluyendo CPU, Vulkan, ROCm 10.0, OpenVINO, SYCL, CUDA 12/13 y OpenCL Adreno.
Esta actualización garantiza un rendimiento optimizado para el hardware M3 mientras expande la disponibilidad de binarios precompilados en múltiples sistemas operativos y arquitecturas GPU.