Le backend Metal dans llama.cpp a été étendu pour prendre en charge les types de tenseurs f16 et bf16 pour l'opérateur concat, en plus de la prise en charge existante de f32 et i32. Cette mise à jour inclut des modèles de noyau spécialisés, des accesseurs de pipeline mis à jour et une dispatch de noyau basée sur le type améliorée, avec l'assistance de pi:llama.cpp/Qwen3.6-27B.
Le backend Metal ajoute la prise en charge de f16 et bf16 pour l'opérateur concat
llama.cpp Release b9741 Ajoute de Nouveaux Binaires et Support
llama.cpp version b9741 introduit de nouveaux binaires pour macOS, Linux, Android, Windows et openEuler sur plusieurs architectures. La release inclut le support pour Vulkan, CUDA 12.4 et 13.3, OpenVINO, SYCL et ROCm, avec des versions mises à jour pour iOS et Ubuntu.
ggml optimise AMX avec aplatissement de partition
Le projet ggml a optimisé les performances d'AMX en aplatissant la partition sur n_batch * M, garantissant que tous les threads participent à la quantification. Cette amélioration augmente la vitesse jusqu'à 1,47x sur divers modèles et configurations matérielles sur les plateformes CPU et GPU, avec des résultats montrant des gains constants dans le temps d'inférence.
ggml-webgpu ajoute des commutateurs d'adaptateur F16 pour Vulkan et NVIDIA
Le projet ggml-webgpu a ajouté des commutateurs d'adaptateur pour la prise en charge de la demi-précision (F16) sur les GPU Vulkan et NVIDIA. Cette mise à jour permet d'améliorer les performances sur le matériel compatible sur plusieurs plateformes, y compris macOS, Linux, Android, Windows et openEuler, avec des builds spécifiques disponibles pour les architectures ARM et x64.
LLaMA.cpp Release b9729 : nouveaux binaires et prise en charge de plateformes
LLaMA.cpp publie la version b9729 avec des binaires pour macOS, Linux, Android, Windows et openEuler sur plusieurs architectures. La release inclut le support CPU, Vulkan, OpenVINO, SYCL et ROCm, ainsi qu'un nouveau package UI. Les références internes à 'webui' ont été supprimées.
llama.cpp Release b9703 : Mises à jour et téléchargements binaires
llama.cpp version b9703 inclut une refonte de la gestion des presets du serveur, supprimant le support des presets HF distants et les fonctions dépréciées. La release fournit des binaires pour macOS, Linux, Android, Windows et openEuler sur plusieurs architectures et options d'accélération matérielle, y compris Vulkan, CUDA, OpenVINO et SYCL.