Le projet llama.cpp a publié la version b11059, qui introduit des mises à jour significatives pour le backend Metal sur les matériels Apple Silicon. Le changement principal est l'ajout du support des entrées F16 au noyau de Transformée de Walsh-Hadamard rapide (FWHT), lui permettant de lire directement des sources F16 sans nécessiter de copie convertie.

  • Le noyau FWHT Metal accepte désormais les entrées F16 en rendant le type source un paramètre de modèle, tandis que les instanciations F32 restent inchangées.
  • Une sélection papillon sans branche dans le noyau SIMD du groupe FWHT remplace les opérateurs ternaires, offrant un gain de performance de 3,0 % (1285,0 µs contre 1324,6 µs) sur un M5 Pro pour de grands matmuls de Hadamard.
  • Les prédicats de dispatch ont été déplacés vers ggml-metal-common pour corriger la build macos-latest-arm64 et assurer la cohérence entre supports_op et la logique de dispatch.
  • La version inclut des binaires pour macOS, iOS, Linux, Windows, Android et openEuler sur les backends CPU, CUDA, ROCm, Vulkan, OpenVINO et SYCL.

Cette mise à jour améliore l'efficacité sur Apple Silicon en réduisant la surcharge mémoire et la latence pour les opérations F16 dans le backend Metal.