Tema · Retrieval & RAG
lab Hugging Face Blog · há 29 d · 8 visualizações

NVIDIA lança modelos de embedding Nemotron 3 Embed que ocupam o #1 no RTEB

A NVIDIA lançou o Nemotron 3 Embed, uma coleção de modelos de embedding abertos e comercialmente disponíveis projetados para melhorar a qualidade de recuperação para RAG em escala de produção, recuperação agêntica, recuperação de código e memória de agentes. A coleção inclui um modelo de 8B que ocupa a #1 posição geral no ranking do RTEB, junto com variantes eficientes de 1B otimizadas para implantação.

arxiv arXiv cs.AI · há 2 d HealthBench · 51.9% · 4 visualizações

RAG clínico VITA iguala ou supera LLMs de ponta no HealthBench

Um sistema de geração aumentada por recuperação projetado especificamente chamado VITA, destinado a contextos de baixa e média renda, foi avaliado em comparação com modelos de linguagem grandes de propósito geral no benchmark HealthBench. O estudo demonstra que o design específico do corpus pode manter um desempenho competitivo mesmo à medida que novos modelos de ponta são lançados.

arxiv arXiv cs.LG · há 2 d HealthBench · 51.9% · 5 visualizações

Sistema RAG clínico VITA iguala ou supera LLMs de ponta no HealthBench

Um sistema de geração aumentada por recuperação (RAG) feito sob medida chamado VITA, projetado para ambientes de baixa e média renda, foi avaliado contra modelos de linguagem grandes de propósito geral no benchmark HealthBench. Em 4.023 perguntas avaliadas por um juiz GPT-4.1, o VITA ficou em primeiro lugar com 51,9% dos pontos possíveis da rubrica, superando GPT-5.4, o4-mini, Gemini 3.1 Pro e Claude Sonnet 4.6.

media Hugging Face Forums · há 12 d · 7 visualizações

IntelShed combina RAG híbrido, resolução de entidades GNN, aprendizado federado e orquestração multiagente LLM

O autor apresenta o IntelShed, um sistema de código aberto para inteligência de fonte aberta (OSINT) que agrega 50 feeds de dados públicos para produzir relatórios automatizados de segurança de 24 horas. A arquitetura integra recuperação híbrida, resolução de entidades baseada em GNN, aprendizado federado com privacidade diferencial e orquestração multiagente compilada por LLM.

media Hugging Face Forums · há 16 d · 3 visualizações

TIS 2.0 elimina viés de posição no RAG reordenando passagens com pontuações de importância de tokens

A atualização TIS 2.0 introduz uma capacidade de reordenação de passagens que elimina o viés de posição "perdido-no-meio" na geração aumentada por recuperação, sem exigir treinamento adicional. Ao aplicar pontuações aprendidas de importância de tokens para reordenar documentos recuperados, o sistema alcança lacuna zero de posição e melhora a precisão de correspondência exata em 5 pontos percentuais em relação às linhas de base.

media Hugging Face Forums · há 18 d · 2 visualizações

Revisão do DESi: uma habilidade instalável do Claude para revisão estruturada de artigos epistêmicos

O autor lançou o DESi Review, uma aplicação prática da estrutura de governança epistêmica DESi independente de modelo, empacotada como uma habilidade instalável do Claude. Esta ferramenta executa um pipeline estruturado de revisão de artigos sobre texto em inglês, separando a extração determinística de afirmações da adjudicação baseada em modelos.

media r/LocalLLaMA · há 23 d · 6 visualizações

PaddlePaddle lança HPD-Parsing, um modelo de 1B com decodificação paralela hierárquica

O PaddlePaddle apresentou o HPD-Parsing, um modelo leve de parsing de documentos com 1 bilhão de parâmetros que utiliza um paradigma de Decodificação Paralela Hierárquica para melhorar a taxa de transferência. A arquitetura coordena a estrutura global da página por meio de um ramo principal de layout, enquanto direciona a geração de conteúdo localizado para ramos concorrentes, utilizando Predição Progressiva de Múltiplos Tokens para reduzir as etapas de decodificação.

media Hugging Face Forums · há 24 d · 1 visualização

Autor propõe registro aberto de k para saturação de evidência em LLMs locais

O autor publicou um artigo piloto e um registro aberto no Hugging Face para medir o ponto de saturação de evidência (k*) dos modelos de linguagem. Esta métrica determina o número ideal de fragmentos de evidência a injetar nos prompts, pois adicionar mais contexto não melhora monotonicamente a correção e pode aumentar o custo ou a contaminação epistêmica.

media Hugging Face Forums · há 28 d · 3 visualizações

Memória Agente Hierárquica usa embeddings hiperbólicos para recuperação estruturada

Uma nova arquitetura de memória emprega embeddings hiperbólicos para organizar entradas de banco de dados vetorial por uma "pontuação de abstração", permitindo que agentes gerenciem o conhecimento de forma mais eficaz do que os sistemas RAG planos. Essa abordagem estrutura os dados de modo que entradas abstratas, como preferências, fiquem próximas ao centro, enquanto eventos concretos residem na fronteira, facilitando melhor agrupamento e recuperação.

media Hugging Face Forums · há 29 d

ShinBay-UCTF propõe um arcabouço conceitual para aprendizado contínuo preservador de privacidade e conhecimento comprimido

K7007 apresenta o ShinBay-UCTF, um arcabouço conceitual que aborda limitações em sistemas de IA relacionadas à redundância multilíngue, memória episódica persistente e adaptação contínua. A proposta delineia uma arquitetura unificada composta por três camadas interagentes: Universal Compressed Training Format (UCTF), Memória Episódica Inspirada Biologicamente e Aprendizado Contínuo Orientado pelo Ambiente.