Source · llama.cpp
github llama.cpp · il y a 9 h · 1 vue

llama.cpp b11282 définit CUDA_ARCH pour les passes de périphérique MUSA

Le projet llama.cpp a publié la compilation b11282, qui inclut une correction pour définir la macro `CUDA_ARCH` pour les passes de périphérique MUSA. Auparavant, l'en-tête du fournisseur MUSA ne définissait pas cette variable, ce qui faisait que les tests d'architecture dans les sources partagées ggml-cuda étaient évalués à zéro et entraînaient des corps de noyau vides.

github llama.cpp · il y a 19 h · 2 vues

llama.cpp b11266 charge les matrices A F32 par deux pour Vulkan sur Intel

Le projet llama.cpp a publié la version b11266, qui inclut une optimisation Vulkan chargeant les matrices A F32 par deux éléments lorsqu'elles sont alignées sur 2. Ce changement résout des problèmes de performance sur le matériel Intel où charger les flottants un par un est inefficace, et corrige également une validation manquante pour l'alignement de `a_offset` dans le patch original.

github llama.cpp · il y a 1 j · 1 vue

llama.cpp b11258 supprime le service worker de l'interface intégrée lorsque l'UI n'est pas servie

Le projet llama.cpp a publié la compilation b11258, qui inclut une correction pour le comportement du service worker de l'interface web intégrée. Auparavant, l'utilisation de drapeaux comme `--path` ou `--no-ui` faisait que les navigateurs conservaient des versions en cache de l'interface car le serveur renvoyait un 404 pour `/sw.js`, ce qui ne déclenche pas la suppression du service worker.

github llama.cpp · il y a 1 j · 7 vues

llama.cpp b11254 corrige la collecte des entrées du graphe pour le parallélisme de pipeline

Le projet llama.cpp a publié la version b11254, qui inclut une correction concernant la manière dont les tenseurs d'entrée sont collectés dans le graphe de calcul. Auparavant, `graph_inputs` était peuplé lors du fractionnement du graphe, ce qui provoquait des problèmes avec le parallélisme de pipeline où la commutation entre des lots consommant différentes entrées entraînait des comparaisons d'ID backend erronées et forçait des réréservations du planificateur.

github llama.cpp · il y a 2 j · 4 vues

llama.cpp b11238 ajoute ggml_pad_ext pour le remplissage à gauche et ignore les taps de DFlash2

Le projet llama.cpp a publié la version b11238, introduisant une implémentation unifiée du remplissage à gauche via la nouvelle fonction `ggml_pad_ext`. Ce changement consolide les méthodes précédentes utilisées par les encodeurs audio tels que Parakeet, LFM2-Audio, Granite Speech et Gemma 4, garantissant des embeddings bit-à-bit identiques pour Gemma 4 tout en simplifiant le support des backends.