El proyecto llama.cpp ha lanzado la versión b10739, que incluye una optimización de rendimiento específica para el hardware Apple M2 Max. Esta actualización introduce el ajuste de vectores de atención rápida (fa-vec) adaptado a los 30 núcleos GPU del M2 Max.
- Añadidas filas de ajuste fa-vec para M2 Max recopiladas con ggml-metal-tuning en dtypes f16 y q8_0.
- Proporcionados binarios para macOS Apple Silicon, Macs Intel, iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm), Android y openEuler.
Este lanzamiento asegura un rendimiento de inferencia optimizado en el último Apple silicon mientras mantiene un amplio soporte a través de varios sistemas operativos y aceleradores de hardware.