Тема · Retrieval & RAG
lab Hugging Face Blog · 24 д назад · 8 просмотров

NVIDIA выпускает модели встраивания Nemotron 3 Embed, занимающие #1 место в RTEB

NVIDIA выпустила Nemotron 3 Embed, набор открытых и коммерчески доступных моделей встраивания, предназначенных для улучшения качества поиска по базе знаний (RAG) производственного масштаба, агентного поиска, поиска по коду и памяти агентов. В коллекцию входит модель объемом 8B, занимающая #1 место в общем зачете на доске лидеров RTEB, а также эффективные варианты объемом 1B, оптимизированные для развертывания.

media Hugging Face Forums · 3 д назад

Aletheion выпускает ASM-CM: компактная архитектура памяти для персистентных AI-агентов

Фелипе Майя Мунис из AletheionAGI представляет ASM-CM (Aletheion Compact Memory Model), экспериментальную архитектуру, которая разделяет память и язык, позволяя истории агента расти без увеличения активного вычислительного объема памяти.

media Hugging Face Forums · 6 д назад · 3 просмотра

IntelShed объединяет гибридный RAG, разрешение сущностей GNN, федеративное обучение и многоагентную оркестровку LLM

Автор представляет IntelShed, систему с открытым исходным кодом для сбора открытых разведывательных данных (OSINT), которая агрегирует 50 публичных источников данных для автоматического формирования ежедневных сводок по безопасности. Архитектура интегрирует гибридный поиск, разрешение сущностей на основе GNN, федеративное обучение с дифференциальной приватностью и многоагентную оркестровку, скомпилированную LLM.

media Hugging Face Forums · 10 д назад · 1 просмотр

TIS 2.0 устраняет смещение позиции в RAG за счёт переупорядочивания фрагментов по баллам важности токенов

Обновление TIS 2.0 внедряет возможность переупорядочивания фрагментов, которая устраняет систематическую ошибку «потеряно посередине» (position bias) в генерации с дополнением извлечёнными данными без необходимости дополнительного обучения. Применяя выученные баллы важности токенов для переупорядочивания извлечённых документов, система достигает нулевого позиционного разрыва и повышает точность полного совпадения (exact match) на 5 процентных пунктов по сравнению с базовыми моделями.

media Hugging Face Forums · 11 д назад · 1 просмотр

Графы памяти с взвешенным вниманием используют внимание Jina для обхода графового RAG

Новое предложение описывает структуру памяти LLM, которая объединяет позднее разбиение на фрагменты (late chunking) с рёбрами, взвешенными по вниманию, чтобы обеспечить пошаговый обход. Система использует модель встраивания от Jina AI, которая вычисляет внимание между предложениями, для получения весов рёбер из внутренней обработки документа.

media Hugging Face Forums · 12 д назад · 2 просмотра

Обзор DESi Review: устанавливаемое расширение Claude для структурированного эпистемологического рецензирования статей

Автор выпустил DESi Review, практическое применение модели-независимой фреймворка эпистемологического управления DESi, упакованное в виде устанавливаемого расширения Claude. Этот инструмент запускает структурированный конвейер рецензирования статей по английскому тексту, разделяя детерминированное извлечение утверждений и основанную на модели оценку.

media Hugging Face Forums · 16 д назад · 1 просмотр

Обсуждение в сообществе о возможности использования доменных LLM на 7B–14B параметров в продакшене

Пользователь форума Hugging Face исследует, могут ли небольшие доменные большие языковые модели (LLM) с числом параметров от 7B до 14B эффективно заменять более крупные модели в реальных производственных средах.

media Hugging Face Forums · 17 д назад

ELIZA с разреженным автоэнкодером

Новая реализация чат-бота ELIZA использует архитектуру разреженного автоэнкодера для хранения записей разговора в слое латентной памяти, стремясь улучшить традиционные методы сопоставления ключевых слов. Система применяет структуру энкодер-декодер T5 с 32768-нейронным слоем памяти, где похожие записи активируются посредством контрастивного обучения.

media r/LocalLLaMA · 17 д назад · 3 просмотра

PaddlePaddle выпускает HPD-Parsing, модель на 1 млрд параметров с иерархическим параллельным декодированием

PaddlePaddle представила HPD-Parsing, легковесную модель для разбора документов на 1 миллиард параметров, которая использует парадигму иерархического параллельного декодирования для повышения пропускной способности. Архитектура координирует глобальную структуру страницы через основной ветвь разметки, одновременно направляя генерацию локализованного контента в параллельные ветви, применяя прогрессивное многозадачное предсказание для сокращения шагов декодирования.

media Hugging Face Forums · 18 д назад · 1 просмотр

Автор предлагает открытый реестр k для насыщения доказательствами в локальных LLM

Автор опубликовал пилотную статью и открытый реестр на Hugging Face для измерения точки насыщения доказательствами (k*) языковых моделей. Этот метрика определяет оптимальное количество фрагментов доказательств, которые следует внедрять в промпты, поскольку добавление большего количества контекста не монотонно улучшает корректность и может увеличить стоимость или эпистемическое загрязнение.

media Hugging Face Forums · 22 д назад · 3 просмотра

Иерархическая агентная память использует гиперболические вложения для структурированного поиска

Новая архитектура памяти применяет гиперболические вложения для организации записей векторной базы данных по «оценке абстракции», позволяя агентам эффективнее управлять знаниями, чем плоским системам RAG. Этот подход структурирует данные так, что абстрактные записи, такие как предпочтения, находятся ближе к центру, а конкретные события — на границе, что способствует лучшему кластеризованию и поиску.

media Hugging Face Forums · 23 д назад

ShinBay-UCTF предлагает концептуальную модель для непрерывного обучения с сохранением конфиденциальности и сжатых знаний

K7007 представляет ShinBay-UCTF, концептуальную модель, устраняющую ограничения ИИ-систем в части многоязычной избыточности, персистирующей эпизодической памяти и непрерывной адаптации. Предложение описывает единую архитектуру из трёх взаимодействующих слоёв: Universal Compressed Training Format (UCTF), Биологически вдохновлённая эпизодическая память и Окружающая среда как драйвер непрерывного обучения.

arxiv arXiv cs.AI · 23 д назад · 1 просмотр

RAGU представляет многоэтапный движок GraphRAG с компактным экстрактором Meno-Lite-0.1

RAGU — это модульный движок GraphRAG с открытым исходным кодом, который улучшает интеграцию структурированных знаний за счёт разделения извлечения сущностей и их консолидации. Он использует двухэтапный процесс типизированного извлечения, дедупликацию на базе DBSCAN, суммаризацию LLM и обнаружение сообществ по алгоритму Leiden для снижения уровня шума и хрупкости, характерных для однопроходных систем.

media Hugging Face Forums · 25 д назад

Команда Hugging Face оценивает Apidog как альтернативу Stoplight для рабочих процессов API с ИИ

Сотрудник команды Hugging Face оценивает Apidog в качестве альтернативы Stoplight для управления API, связанными с моделями Hugging Face и Inference Endpoints. Цель заключается в консолидации проектирования API, документации, тестирования и автоматизации в едином рабочем процессе.

arxiv arXiv cs.CL · 25 д назад · 2 просмотра

Языковые модели без знаний подавляют параметрическое воспроизведение для рассуждений, основанных на доказательствах

Исследователи представляют языковые модели без знаний (KLLMs), парадигму обучения, которая анонимизирует именованные сущности во время предварительного обучения, чтобы отвлечь модели от параметрического воспроизведения фактов в сторону рассуждений, основанных на доказательствах.

media Hugging Face Forums · 25 д назад

Pathmap.org предлагает движок для литературы на основе открытий с JSON-трассировками

Автор разработал исследовательский движок на pathmap.org, способный генерировать достоверные открытия на основе данных PubMed и OpenAlex. Инструмент предоставляет полные JSON-трассировки, обычно от 1 до 5 МБ, для поддержки исследовательских рабочих процессов.

arxiv arXiv cs.CL · 26 д назад · 1 просмотр

RAGU представляет многоэтапный GraphRAG с компактным экстрактором Meno-Lite-0.1

RAGU — это модульный движок GraphRAG с открытым исходным кодом, который улучшает интеграцию структурированных знаний за счет разделения извлечения и консолидации посредством двухэтапного процесса, включающего типизированное извлечение, удаление дубликатов, суммаризацию и обнаружение сообществ.

media Hugging Face Forums · 30 д назад

Централизованная служба векторной базы данных предоставляет изолированные хранилища FAISS для многопроектного RAG

Автор создал централизованную службу векторной базы данных, контролируемую администратором, которая позволяет нескольким проектам в рамках организации встраивать и извлекать данные из своих собственных изолированных векторных хранилищ. Этот подход устраняет необходимость для каждого проекта поддерживать собственную логику встраивания и дублировать код.

arxiv arXiv cs.CL · 24 д назад

RAGthoven использует многоэтапный RAG-конвейер для сравнения с Gemini 2.5 Flash в генерации многоязычного юмора

Авторы представляют RAGthoven, систему для SemEval-2026 Task 1, которая разбивает креативную генерацию текста на многоэтапный конвейер больших языковых моделей, основанный на теории вычислительного юмора. Финальная конфигурация дополняет Планировщик (Planner) генерацией с извлечением информации (retrieval-augmented generation) из курируемого корпуса шуток и оценивает агентные варианты по сравнению с неагентным базовым уровнем.