El proyecto llama.cpp ha lanzado la versión b10816, que incluye actualizaciones al backend Metal para dispositivos Apple Silicon. El lanzamiento se centra en añadir los ajustes restantes de fast-vector específicamente para la arquitectura del chip M3.

  • Añade entradas M3 a fa_vec_tuned_table.
  • Incluye las cuantizaciones q4_0, q4_1, q5_0 y q5_1 en ggml-metal-tuning.
  • Proporciona binarios para macOS (Apple Silicon e Intel), iOS, Linux, Windows, Android y openEuler.
  • Soporta varios backends incluyendo CPU, Vulkan, ROCm 10.0, OpenVINO, SYCL, CUDA 12/13 y OpenCL Adreno.

Esta actualización garantiza un rendimiento optimizado para el hardware M3 mientras expande la disponibilidad de binarios precompilados en múltiples sistemas operativos y arquitecturas GPU.