Le projet llama.cpp a publié la version b10739, qui comprend une optimisation de performance spécifique pour le matériel Apple M2 Max. Cette mise à jour introduit le réglage des vecteurs d'attention rapide (fa-vec) adapté aux 30 cœurs GPU du M2 Max.
- Ajout des lignes de réglage fa-vec pour M2 Max collectées avec ggml-metal-tuning sur les types de données f16 et q8_0.
- Fourniture de binaires pour macOS Apple Silicon, Macs Intel, iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm), Android et openEuler.
Cette version garantit des performances d'inférence optimisées sur le dernier Apple silicon tout en maintenant un large support à travers divers systèmes d'exploitation et accélérateurs matériels.