Retrieval & RAG
media Hugging Face Forums · il y a 4 j · 9 vues

Le routage sémantique réduit de 41 % les jetons d'entrée et la latence de 45 % lors d'un test de stress sur un contexte de 14K

Un test de stress GPU utilisant Qwen2.5-7B-Instruct gelé en 4 bits sur les questions de pont HotpotQA démontre que le routage sémantique conscient de la tâche améliore significativement l'efficacité et la précision dans des conditions à fort distracteur. L'étude a comparé un contexte complet limité à un sélecteur sémantique conscient de la requête conservant 60 % du budget, révélant des gains substantiels en vitesse et en précision.

media Hugging Face Forums · il y a 5 j · 12 vues

jbsalles présente SelMem, un projet expérimental en Rust pour la mémoire sélective des LLM

L'auteur présente SelMem, un projet expérimental à un stade précoce écrit en Rust qui explore si les agents LLM peuvent développer une divergence comportementale persistante grâce à un système de mémoire reconstructive. Ce système permet aux agents d'oublier, de déformer et de consolider des expériences au fil du temps, ce qui peut potentiellement conduire à des récits internes différents même avec des historiques identiques.

lab Google — The Keyword (AI) · il y a 6 j · 25 vues

L'ONU lance le System Data Commons pour unifier les statistiques mondiales

Le système de l'ONU lance le UN System Data Commons, une plateforme open-source construite sur Google's Data Commons qui unit les statistiques mondiales en une seule ressource interconnectée connue sous le nom de graphe de connaissances prêt pour l'IA. Soutenu par Google.org, le projet vise à rendre les données critiques universellement accessibles et à aider à suivre les progrès mondiaux en temps réel.

media Hugging Face Forums · il y a 9 j · 16 vues

Sean Everett lance Shared Memory, un carnet public pour les agents avec connecteur MCP

Sean Everett a lancé Shared Memory, un carnet public conçu pour permettre à un agent IA de laisser des découvertes réutilisables qu'un autre agent peut accéder sans répéter toute la conversation. Le projet inclut un Space statique gratuit sur Hugging Face pour rechercher et lire des notes, ainsi qu'un connecteur MCP sous licence MIT exposant des outils de recherche, de lecture et de publication.

media Hugging Face Forums · il y a 11 j · 16 vues

pop123-ux publie 38 notebooks exécutables pour apprendre Hugging Face en supprimant les abstractions

L'utilisateur pop123-ux a publié un référentiel d'apprentissage contenant 38 notebooks exécutables conçus pour aider les utilisateurs à comprendre la pile Hugging Face en supprimant progressivement les abstractions de haut niveau. La collection couvre un parcours allant des composants centraux comme transformers et tokenizers jusqu'au fine-tuning, PEFT, raisonnement/RL et au travail sur des projets de bout en bout.

lab OpenAI News · il y a 13 j · 31 vues

OpenAI présente ChatGPT pour les services financiers avec des données intégrées et GPT-6 Astra

OpenAI a lancé ChatGPT pour les services financiers, une expérience sur mesure combinant le raisonnement de GPT-6 Astra à des données financières premium intégrées pour aider les équipes dans la recherche, la modélisation et la création de documents clients. Le produit a été développé en partenariat avec Morgan Stanley et Evercore afin de répondre aux principaux défis du secteur bancaire d'investissement et de la recherche en actions.

media Hugging Face Forums · il y a 15 j · 13 vues

PRAMA-Dynamagh transforme les mandats en exécution autonome liée à des preuves sur le protocole Telegraph

PRAMA-Dynamagh est une couche de contrôle agnostique au domaine construite sur le protocole Telegraph qui convertit les mandats des humains, applications ou agents en trajectoires d'exécution auditées. Il comble l'écart entre la réception de renseignements et l'autorisation d'agir en liant les décisions à des preuves vérifiables.

lab Tencent Hunyuan (HF) · il y a 16 j · 28 vues

Tencent publie EVIE-8B, un modèle de récupération de documents visuels à 4096D

Tencent a publié EVIE-8B, un modèle de récupération de documents visuels à haute capacité présentant des représentations de tokens en 4096 dimensions et une attention bidirectionnelle complète. Le modèle sert de base enseignante pour la variante légère EVIE-4.5B Prefix-MRL et atteint des performances de pointe sur les benchmarks de récupération de documents visuels.