Тема · Training methods
lab Hugging Face Blog · 29 д назад · 43 просмотра

IBM выпустила.reasoning LLM Granite 4.2 с возможностями агентов

IBM выпустила Granite 4.2, семейство плотных декодер-только reasoning больших языковых моделей размером 3B, 8B и 30B. Эти модели обучены с нуля на примерно 15 триллионах токенов и имеют контекстное окно, расширенное до 512K токенов.

media Hugging Face Forums · 20 ч назад · 10 просмотров

SplitMoE вводит тонкую маршрутизацию экспертов для уменьшения избыточности параметров

SplitMoE — это альтернативная архитектура Mixture of Experts, которая разбивает широкие слои прямого распространения на меньшие специализированные подкомпоненты для повышения гибкости представления токенов и вычислительной модульности.

arxiv arXiv cs.AI · 21 ч назад · 11 просмотров

Генератор состояния мира согласует планы с синтетическими мирами для повышения успеха агентов

Генератор состояния мира (WSG) — это модель, которая удерживает планы языковых агентов в соответствии с правилами их среды выполнения, переписывая состояния после неудач. Она обучена на 226K траекториях, извлечённых из семи синтетических доменов, где программа обеспечивает соблюдение правил и проверяет достижимость цели.

arxiv arXiv cs.LG · 1 д назад HealthBench · 50.1% · 9 просмотров

Fathom-Vaidya улучшает медицинское рассуждение с помощью наград по рубрикам

Авторы представляют Fathom-Vaidya, модель с 30B параметров, которая использует синтетические данные и подкрепляющее обучение на основе рубрик для улучшения диагностического и клинического рассуждения в здравоохранении. Процесс обучения сначала применяет RL, управляемый правилами, к вопросам из MedBullets для диагностики, а затем использует 5.3k синтетических многошаговых сценариев с многомерными рубриками для интерактивных клинических задач.

arxiv arXiv cs.AI · 1 д назад HealthBench · 50.1% · 12 просмотров

Fathom-Vaidya улучшает медицинское рассуждение с помощью наград по рубрикам

Авторы представляют Fathom-Vaidya, модель с 30B параметров, которая использует синтетические данные и подкрепляющее обучение на основе рубрик для улучшения как диагностического, так и клинического медицинского рассуждения. Процесс обучения сначала направлен на повышение точности диагностики с использованием вопросов, полученных из MedBullets, а затем решает задачи многооборотного клинического взаимодействия через 5.3k сгенерированных сценариев с многомерными рубриками.

arxiv arXiv cs.CL · 1 д назад HealthBench · 50.1% · 12 просмотров

Fathom-Vaidya улучшает медицинское рассуждение с помощью наград по рубрикам

Авторы представляют Fathom-Vaidya, модель с 30B параметров, которая использует синтетические данные и подкрепляющее обучение, основанное на рубриках, для улучшения как диагностического, так и клинического рассуждения в здравоохранении.

media Latent Space · 1 д назад · 13 просмотров

TypeSafe AI представляет Jev — модель System One, обученную с помощью обучения с подкреплением для калиброванных решений

TypeSafe AI выпустила Jev, новый класс моделей «System One», предназначенных для производственных сред. Генеральный директор компании и соавтор статьи InstructGPT Диогу Алмейда утверждает, что современные передовые модели отдавали приоритет выравниванию и отказам вместо надежности, что приводило к таким проблемам, как галлюцинации и сycophancy.

media Hugging Face Forums · 2 д назад · 18 просмотров

MB-Bidram делится экспериментальной архитектурой WideNDepth, разделяющей рассуждение и знания

MB-Bidram выпустила экспериментальную нейронную архитектуру под названием WideNDepth (WND), предназначенную для разделения способностей к рассуждению и хранения знаний. Модель состоит из «Wide части», которая функционирует как память, и «Depth части», которая действует как механизм рассуждения.

media Hugging Face Forums · 3 д назад · 16 просмотров

Предложение о прогрессивном росте моделей и открытом профиле оборудования для Трансформеров

Предложение на Hugging Face обсуждает две взаимосвязанные проблемы в ИИ: зависимость от обучения отдельных больших моделей и зависимость экосистемы от универсальных GPU.

media Hugging Face Forums · 3 д назад · 18 просмотров

Предложение: прогрессивная передача знаний от Qwen 9B к 27B для фиксированной модели на 4B

Пользователь на форумах Hugging Face предлагает эксперимент по прогрессивной передаче знаний, в котором студентская модель фиксированного размера (Qwen 4B) последовательно обучается у всё более крупных моделей-учителей, а не напрямую у самой большой из доступных.

media MarkTechPost · 6 д назад · 20 просмотров

OpenAI публикует фреймворк раскрытия информации о несовпадении моделей с тремя путями рассмотрения

OpenAI представила новый фреймворк для отслеживания, расследования и раскрытия информации о несовпадении (misalignment) в своих моделях, сопровождаемый шестью подробными отчетами об инцидентах из обучения с подкреплением. Система устанавливает конкретные критерии и сроки для публичного раскрытия информации, применяясь даже в тех случаях, когда поведение полностью не объяснено или не смягчено.

media Hugging Face Forums · 7 д назад · 15 просмотров

ByteLex использует карту токенизатора для прогнозирования и исправления ошибок модели байтов

Исследователи ByteLex создали координатное пространство из 11 словарей токенизаторов, чтобы предсказать, на каких вымышленных словах их байтовая языковая модель даст сбой. Карта показала коэффициент корреляции Спирмена -0.98 с измеренной точностью модели по словам, превзойдя статистику, полученную из корпусов.

arxiv arXiv cs.LG · 7 д назад · 20 просмотров

OpenAI выпустила Open-1B с полностью проверяемым процессом обучения

OpenAI выпустила Open-1B, языковую модель, обученную в условиях, при которых каждая операция во время обучения может быть независимо воспроизведена на разнородном стандартном оборудовании с битовой точностью. Этот подход решает проблемы воспроизводимости, присущие моделям с открытым исходным кодом, путем установления строгого порядка для источников недетерминизма, таких как редукция GPU-ядер и порядок формирования пакетов данных.

lab Hugging Face Blog · 9 д назад · 16 просмотров

TRL v1.14 AsyncGRPOTrainer обеспечивает синхронизацию только LoRA в рамках Hugging Face Jobs

TRL v1.14 добавляет поддержку LoRA для AsyncGRPOTrainer, позволяя обучать адаптер Low-Rank Adaptation и синхронизировать только этот небольшой файл с inference-воркерами vLLM. Эта архитектура разделяет задачи обучения и генерации на разных машинах, используя общий Storage Bucket в качестве файлового моста, что устраняет необходимость в NCCL или прямой сетевой коммуникации между узлами.

media Hugging Face Forums · 10 д назад · 16 просмотров

pop123-ux выпускает 38 рабочих блокнотов для изучения Hugging Face путем устранения абстракций

Пользователь pop123-ux опубликовал обучающий репозиторий, содержащий 38 рабочих блокнотов, предназначенных для помощи пользователям в понимании стека Hugging Face за счет постепенного устранения высокоуровневых абстракций. Коллекция охватывает путь от основных компонентов, таких как transformers и tokenizers, до тонкой настройки, PEFT, рассуждений/RL и работы над проектами от начала до конца.

media Together AI Blog · 12 д назад Terminal-Bench 2 · 88.2% · 30 просмотров

Together AI расширяет возможности тонкой настройки с помощью экспертного LoRA, метрик в реальном времени и снижения цен

Together AI расширила свой сервис тонкой настройки для поддержки более широкого спектра моделей с открытым весом, включая GLM-5.3 и Kimi K2.7, а также представила отслеживание экспериментов в реальном времени и более точный контроль над процессом обучения.

media MarkTechPost · 12 д назад Berkeley Function-Calling Leaderboard · 83.2% · 18 просмотров

Google Research выпустила ToolGrad — фреймворк для генерации данных использования инструментов

Исследователи из Google и нескольких японских университетов представили ToolGrad, фреймворк, который инвертирует традиционный конвейер генерации наборов данных для использования инструментов: сначала создаются проверенные цепочки вызовов API, а затем пишутся соответствующие пользовательские запросы. Этот подход направлен на устранение неэффективности методов, основанных на первоочередном формировании запросов, которые часто терпят неудачу при исследовании агентами.

arxiv arXiv cs.CL · 14 д назад SWE-bench Verified · 72.6% · 25 просмотров

ExecCritic использует ролевое RL для улучшения кодогенерирующих агентов через тест-ориентированное исправление

Исследователи представляют ExecCritic — фреймворк, сочетающий структуру test-verify-revise с ролевым обучением с подкреплением для повышения эффективности кодогенерирующих агентов. Система разделяет создание тестов и исправление исходного кода: Test-агент генерирует тесты, специфичные для репозитория, а Repair-агент корректирует код на основе обратной связи от выполнения.

media Hugging Face Forums · 16 д назад · 15 просмотров

memaudit внедряет приманки для аудита запоминания во время SFT-обучения

memaudit — это инструмент, который интегрируется с библиотекой TRL для проверки того, привело ли дообучение моделей на частных данных к их запоминанию. Он работает путём внедрения калиброванных приманок в набор данных и мониторинга функции потерь в процессе обучения.