Le projet llama.cpp a publié la version b10816, qui inclut des mises à jour du backend Metal pour les appareils Apple Silicon. La publication se concentre sur l'ajout des derniers réglages fast-vector spécifiquement pour l'architecture de la puce M3.

  • Ajoute des entrées M3 à fa_vec_tuned_table.
  • Inclut les quantifications q4_0, q4_1, q5_0 et q5_1 dans ggml-metal-tuning.
  • Fournit des binaires pour macOS (Apple Silicon et Intel), iOS, Linux, Windows, Android et openEuler.
  • Prend en charge divers backends dont CPU, Vulkan, ROCm 10.0, OpenVINO, SYCL, CUDA 12/13 et OpenCL Adreno.

Cette mise à jour garantit des performances optimisées pour le matériel M3 tout en élargissant la disponibilité des binaires précompilés sur plusieurs systèmes d'exploitation et architectures GPU.