Sujet · Local inference
lab Hugging Face Blog · il y a 8 h · 3 vues

Hugging Face publie 207 noyaux WebGPU et un outil de benchmarking navigateur

Hugging Face a publié @huggingface/kernels, une bibliothèque pour charger et exécuter des noyaux WebGPU optimisés depuis le Hub Hugging Face, accompagnée d'une collection initiale de 207 noyaux. La publication introduit également Fleet, une suite de benchmarking GPU dans le navigateur qui mutualise les preuves de performance et de correction issues des appareils des utilisateurs.

github llama.cpp · il y a 1 j · 9 vues

llama.cpp b10718 étend la fusion MOE à specdec et multi-token

Le projet llama.cpp a publié la version b10718, qui comprend une mise à jour significative de son backend CUDA. Le changement le plus notable est l'extension de la fusion Mixture of Experts (MOE) pour prendre en charge le décodage spéculatif (specdec), répondant aux limitations précédentes où la fusion MOE glu et topk-router était restreinte au traitement d'un seul token à la fois.

github llama.cpp · il y a 2 j · 11 vues

llama.cpp b10707 optimise le balayage des cellules du cache KV pour une génération plus rapide

Le projet llama.cpp a publié la version b10707, qui inclut une optimisation de performance pour la gestion du cache clé-valeur (KV). La mise à jour modifie la fonction `for_each_token_in` pour arrêter le balayage dès que toutes les séquences au sein d'une cellule spécifique ont été traitées, plutôt que d'itérer sur toutes les séquences maximales possibles.

github llama.cpp · il y a 5 j · 7 vues

llama.cpp b10666 corrige les tests de sauvegarde/chargement d'état et la copie de séquence sur l'appareil

La version llama.cpp b10666 élargit la suite de tests de sauvegarde/chargement d'état pour s'exécuter sur toutes les architectures et résout plusieurs bugs critiques dans la gestion de l'état et le traitement du graphe. Les modifications clés incluent la correction des références pendantes dans minimax-01, l'alignement de la copie de chunks pour les séquences sur l'appareil, et la correction des comptes de têtes d'indexeur pour deepseek4.