Inference efficiency
arxiv arXiv cs.AI · il y a 4 h · 9 vues

CliffCompaction réduit de 50 % les coûts des agents de codage tout en maintenant la performance

Les chercheurs présentent CliffCompaction, une technique d'autocompaction conçue pour réduire les coûts des agents de codage à long terme jusqu'à 50 % dans un contexte borné. La méthode maintient ou améliore la performance sur Terminal-Bench et atteint des résultats de pointe sur KernelBench en conservant une information compacte fidèle par troncature plutôt que par reformulation.

arxiv arXiv cs.LG · il y a 5 h · 9 vues

CliffCompaction réduit les coûts des agents de codage à long terme jusqu'à 50 % tout en maintenant les performances

Les chercheurs présentent CliffCompaction, une technique d'autocompaction conçue pour les agents traitant des millions de tokens, qui réduit les coûts jusqu'à 50 % dans un contexte borné. La méthode maintient ou améliore les performances sur Terminal-Bench et atteint des résultats de pointe sur KernelBench en conservant la fidélité de l'information par troncature plutôt que par reformulation.

github llama.cpp · il y a 17 h · 9 vues

llama.cpp ajoute le support de DFlash pour HunyuanOCR et corrige la conversion des brouillons

Le projet llama.cpp a ajouté le support du décodage spéculatif DFlash avec le modèle HunyuanOCR en exposant les tenseurs d'entrée des couches dans le graphe cible. Ce changement permet au modèle de brouillon de lire les flux résiduels, permettant aux requêtes d'image de s'exécuter avec succès avec un taux d'acceptation du brouillon d'environ 0,5 et une sortie OCR identique en octets par rapport aux exécutions non spéculatives.

lab Hugging Face Blog · il y a 21 h · 10 vues

Transformers ajoute le support GGUF via les noyaux ggml pour l'inférence locale

La bibliothèque Transformers de Hugging Face prend désormais en charge le chargement de modèles quantifiés GGUF, en s'appuyant sur les noyaux ggml sous-jacents pour offrir des performances proches de celles de llama.cpp. Cette intégration permet aux développeurs d'exécuter des points de contrôle quantifiés directement au sein de l'API standard basée sur PyTorch sur le matériel pris en charge.

media Hugging Face Forums · il y a 1 j · 11 vues

Un utilisateur cherche un workflow pour abréger Llama-Krikri-8B-Instruct pour une utilisation locale en grec

Un utilisateur prévoit de construire un grand modèle de langage natif au grec et sans censure pour un déploiement local en utilisant le checkpoint ilsp/Llama-Krikri-8B-Instruct. Le plan proposé implique d'abréger le modèle avec Heretic (heretic-llm), de le convertir au format GGUF Q4_K_M, et d'exécuter l'inférence sur un GMKtec EVO-X3 équipé d'un processeur AMD Ryzen AI MAX+ 395 via Vulkan.

media Together AI Blog · il y a 1 j · 11 vues

Together AI introduit les déploiements Canary pour mettre à jour les modèles en production sans interruption de service

Together AI a introduit les déploiements Canary, une fonctionnalité qui migre le trafic en direct d'un modèle actuel vers un nouveau checkpoint par étapes avec des portes (gates). Ce système automatise le mécanisme de sécurité pour l'échange de modèles en exécutant des vérifications de santé et des portes de métriques optionnelles avant de déplacer le trafic, permettant des pauses et des annulations automatiques si les performances se dégradent.

arxiv arXiv cs.AI · il y a 1 j · 9 vues

AgentRouter réduit les coûts des workflows agents de 72 % grâce au routage modèle par étape

Les chercheurs proposent AgentRouter, un classificateur léger qui optimise les workflows agents multi-étapes en acheminant les étapes individuelles de la trajectoire vers des niveaux de modèles appropriés plutôt que d'utiliser des modèles de pointe pour chaque tâche. Le système répond à l'inefficacité des solutions existantes qui ignorent la complexité variable des sous-tâches au sein d'une seule session agent.

arxiv arXiv cs.CL · il y a 1 j · 11 vues

AgentRouter réduit les coûts des workflows agents de 72 % grâce au routage modèle par étape

Les chercheurs proposent AgentRouter, un classificateur léger qui optimise les workflows agents multi-étapes en acheminant les étapes individuelles des trajectoires vers des niveaux de modèles appropriés plutôt que d'utiliser un seul modèle de pointe pour toutes les tâches. Le système répond à l'inefficacité des systèmes d'entreprise qui gaspillent 60 à 80 % de leur budget d'inférence sur des sous-tâches que des modèles plus petits peuvent traiter aussi bien.