Le projet llama.cpp a publié la version b10673, qui inclut des optimisations de performances spécifiques pour le matériel Apple M4. Cette mise à jour introduit des enregistrements fa_vec_tuned_table dans le module ggml-metal-tuning afin d'améliorer l'efficacité du backend Metal.

  • Ajoute des tables de recherche calibrées pour les quantifications F16, Q4_0, Q4_1, Q5_0, Q5_1 et Q8_0 sur les puces M4 avec 10 cœurs GPU.
  • Fournit des binaires pour macOS Apple Silicon (arm64), macOS Intel (x64) et iOS XCFramework.
  • Inclut des versions Linux pour Ubuntu x64 et arm64 sur les backends CPU, Vulkan, ROCm 7.14, OpenVINO et SYCL.
  • Propose des binaires Windows pour CPU, OpenCL Adreno, CUDA 12/13, Vulkan, OpenVINO, SYCL et ROCm 7.14.
  • Ajoute le support Android arm64 (CPU) et les binaires d'interface utilisateur.

Cette version permet aux utilisateurs d'appareils Apple M4 de tirer parti de noyaux Metal optimisés pour une inférence plus rapide.