Sujet · Retrieval & RAG
lab Hugging Face Blog · il y a 30 j · 8 vues

NVIDIA lance les modèles Nemotron 3 Embed, classés n°1 sur RTEB

NVIDIA a publié Nemotron 3 Embed, une collection de modèles d'embedding ouverts et disponibles commercialement conçus pour améliorer la qualité de récupération pour le RAG à l'échelle de la production, la récupération agentic, la récupération de code et la mémoire des agents. La collection comprend un modèle 8B classé n°1 au classement général du leaderboard RTEB, ainsi que des variantes 1B optimisées pour le déploiement.

arxiv arXiv cs.AI · il y a 2 j HealthBench · 51.9% · 4 vues

Le RAG clinique VITA égale ou surpasse les grands modèles de langage de pointe sur HealthBench

Un système de génération augmentée par récupération conçu spécifiquement, nommé VITA, destiné aux contextes à revenu faible et intermédiaire, a été évalué face à des grands modèles de langage à usage général sur le benchmark HealthBench. L'étude démontre qu'une conception spécifique au corpus peut maintenir des performances compétitives même lorsque de nouveaux modèles de pointe sont publiés.

arxiv arXiv cs.LG · il y a 2 j HealthBench · 51.9% · 5 vues

Le système RAG clinique VITA égale ou surpasse les LLM de pointe sur HealthBench

Un système de génération augmentée par récupération (RAG) conçu spécifiquement, nommé VITA et destiné aux contextes à revenus faibles et moyens, a été évalué contre des modèles de langage larges à usage général sur le benchmark HealthBench. Sur 4 023 questions jugées par un juge GPT-4.1, VITA s'est classé premier avec 51,9 % des points possibles de la grille d'évaluation, surpassant GPT-5.4, o4-mini, Gemini 3.1 Pro et Claude Sonnet 4.6.

media Hugging Face Forums · il y a 12 j · 7 vues

IntelShed combine RAG hybride, résolution d'entités par GNN, apprentissage fédéré et orchestration multi-agents LLM

L'auteur présente IntelShed, un système open-source pour le renseignement d'origine ouverte (OSINT) qui agrège 50 flux de données publics pour produire des briefings de sécurité automatisés sur 24 heures. L'architecture intègre la récupération hybride, la résolution d'entités par GNN, l'apprentissage fédéré avec confidentialité différentielle et l'orchestration multi-agents compilée par LLM.

media Hugging Face Forums · il y a 16 j · 3 vues

TIS 2.0 élimine le biais de position dans le RAG en réordonnant les passages avec des scores d'importance des tokens

La mise à jour TIS 2.0 introduit une capacité de réordonnancement des passages qui élimine le biais de position « lost-in-the-middle » dans la génération augmentée par récupération sans nécessiter d'entraînement supplémentaire. En appliquant des scores d'importance des tokens appris pour réordonner les documents récupérés, le système atteint un écart de position nul et améliore la précision de correspondance exacte de 5 points de pourcentage par rapport aux méthodes de référence.

media Hugging Face Forums · il y a 17 j · 1 vue

Les graphes de mémoire pondérés par l'attention utilisent l'attention de Jina pour la traversée de graph-RAG

Une nouvelle proposition décrit une structure de mémoire LLM qui combine le fractionnement tardif avec des arêtes pondérées par l'attention pour permettre une traversée étape par étape. Le système exploite le modèle d'embedding de Jina AI, qui calcule l'attention entre les phrases, pour dériver les poids des arêtes du traitement interne du document.

media Hugging Face Forums · il y a 18 j · 2 vues

Revue DESi : une compétence Claude installable pour la revue épistémique structurée des articles

L'auteur a publié DESi Review, une application pratique du cadre de gouvernance épistémique DESi indépendant du modèle, emballée sous forme d'une compétence Claude installable. Cet outil exécute un pipeline de revue structurée d'articles sur du texte anglais en séparant l'extraction déterministe des affirmations de leur arbitrage basé sur le modèle.

media Hugging Face Forums · il y a 23 j

ELIZA avec autoencodeur clairsemé

Une nouvelle implémentation du chatbot ELIZA utilise une architecture d'autoencodeur clairsemé pour stocker les entrées de conversation dans une couche de mémoire latente, visant à améliorer les méthodes traditionnelles de correspondance de mots-clés. Le système emploie une structure encodeur-décodeur T5 avec une couche de mémoire de 32 768 neurones, où des entrées similaires sont activées via l'apprentissage contrastif.

media r/LocalLLaMA · il y a 23 j · 6 vues

PaddlePaddle publie HPD-Parsing, un modèle de 1 milliard de paramètres avec décodage parallèle hiérarchique

PaddlePaddle a présenté HPD-Parsing, un modèle léger de parsing de documents comptant 1 milliard de paramètres qui exploite un paradigme de décodage parallèle hiérarchique pour améliorer le débit. L'architecture coordonne la structure globale des pages via une branche de mise en page principale tout en répartissant la génération de contenu localisé vers des branches concurrentes, en utilisant la prédiction multi-jetons progressive pour réduire les étapes de décodage.

media Hugging Face Forums · il y a 24 j · 1 vue

L'auteur propose un registre ouvert de k pour la saturation des preuves dans les LLM locaux

L'auteur a publié un article pilote et un registre ouvert sur Hugging Face pour mesurer le point de saturation des preuves (k*) des modèles de langage. Cette métrique détermine le nombre optimal de fragments de preuves à injecter dans les prompts, car ajouter plus de contexte n'améliore pas de manière monotone la correction et peut augmenter le coût ou la contamination épistémique.

media Hugging Face Forums · il y a 28 j · 3 vues

La mémoire agente hiérarchique utilise des embeddings hyperboliques pour une récupération structurée

Une nouvelle architecture de mémoire emploie des embeddings hyperboliques pour organiser les entrées de la base vectorielle selon un « score d'abstraction », permettant aux agents de gérer les connaissances plus efficacement que les systèmes RAG plats. Cette approche structure les données de sorte que les entrées abstraites, comme les préférences, se situent près du centre tandis que les événements concrets résident à la périphérie, facilitant un meilleur regroupement et une meilleure récupération.

media Hugging Face Forums · il y a 29 j

ShinBay-UCTF propose un cadre conceptuel pour l'apprentissage continu préservant la vie privée et le knowledge compressé

K7007 présente ShinBay-UCTF, un cadre conceptuel visant à combler les lacunes des systèmes d'IA en matière de redondance multilingue, de mémoire épisodique persistante et d'adaptation continue. La proposition décrit une architecture unifiée composée de trois couches interactives : Universal Compressed Training Format (UCTF), Mémoire Épisodique Inspirée du Biologique et Apprentissage Continu Piloté par l'Environnement.