Local inference
github llama.cpp · il y a 17 h · 9 vues

llama.cpp ajoute le support de DFlash pour HunyuanOCR et corrige la conversion des brouillons

Le projet llama.cpp a ajouté le support du décodage spéculatif DFlash avec le modèle HunyuanOCR en exposant les tenseurs d'entrée des couches dans le graphe cible. Ce changement permet au modèle de brouillon de lire les flux résiduels, permettant aux requêtes d'image de s'exécuter avec succès avec un taux d'acceptation du brouillon d'environ 0,5 et une sortie OCR identique en octets par rapport aux exécutions non spéculatives.

lab Hugging Face Blog · il y a 21 h · 10 vues

Transformers ajoute le support GGUF via les noyaux ggml pour l'inférence locale

La bibliothèque Transformers de Hugging Face prend désormais en charge le chargement de modèles quantifiés GGUF, en s'appuyant sur les noyaux ggml sous-jacents pour offrir des performances proches de celles de llama.cpp. Cette intégration permet aux développeurs d'exécuter des points de contrôle quantifiés directement au sein de l'API standard basée sur PyTorch sur le matériel pris en charge.

media Hugging Face Forums · il y a 1 j · 11 vues

Un utilisateur cherche un workflow pour abréger Llama-Krikri-8B-Instruct pour une utilisation locale en grec

Un utilisateur prévoit de construire un grand modèle de langage natif au grec et sans censure pour un déploiement local en utilisant le checkpoint ilsp/Llama-Krikri-8B-Instruct. Le plan proposé implique d'abréger le modèle avec Heretic (heretic-llm), de le convertir au format GGUF Q4_K_M, et d'exécuter l'inférence sur un GMKtec EVO-X3 équipé d'un processeur AMD Ryzen AI MAX+ 395 via Vulkan.