Training methods
arxiv arXiv cs.LG · 2 д назад

U-OPSD позволяет проводить неконтролируемую самодистилляцию на основе текущей политики для больших языковых моделей

Исследователи предлагают метод неконтролируемой самодистилляции на основе текущей политики (U-OPSD), который обеспечивает улучшение после дообучения больших языковых моделей исключительно за счёт собственных генераций модели без внешнего контроля. Подход выбирает несколько последовательностей для построения псевдорешения с помощью большинства голосов, а затем дистиллирует распределение учителя в префиксы самого длинного неверного завершения модели.

media r/LocalLLaMA · 5 д назад

AFM3 20B от Apple использует pruning следования инструкциям для активации ~20% слоёв

Apple представила новую архитектуру для своих фундаментальных моделей третьего поколения (AFM3), которая использует «Pruning следования инструкциям» для значительного снижения количества активных параметров. Модель спроектирована так, чтобы активировать примерно 20% своих MLP слоёв, принимая решения маршрутизации один раз на промпт, а не на токен.

media MarkTechPost · 7 д назад · 4 просмотра

NVIDIA NeMo выпускает Molt, компактную PyT-native агентную RL-фреймворк

Команда NVIDIA NeMo выпустила Molt, фреймворк для агентного обучения с подкреплением с открытым исходным кодом, предназначенный для снижения сложности итераций алгоритмов для исследователей. Базовый код содержит около 8.6K строк RL-кода, что значительно меньше по сравнению со схожими фреймворками, такими как verl (62K строк) и slime (25K строк).

media Hugging Face Forums · 8 д назад

Исследование возможности использования неудачных трасс агентов в качестве данных для тонкой настройки

Автор выдвигает гипотезу о том, что неудачные трассы агентов, использующих инструменты (например, неверный выбор инструментов или некорректные аргументы), могут служить ценными данными для тонкой настройки, чтобы обучать модели избегать этих ошибок. В статье запрашивается обратная связь от сообщества относительно того, является ли обучение на исправленных неудачных трассах эффективным или вредным.

media Hugging Face Forums · 9 д назад

PIN v2 разделяет ширину модели и стоимость хранения за счёт связывания весов

Архитектура PIN v2 предлагает метод предварительного выбора размера нейронной сети и скорости вывода до начала обучения с использованием связывания весов. Эта техника заставляет группы ячеек хранить одинаковые значения, позволяя сети сохранять свою ширину при одновременном резком сокращении числа хранимых весов.

media r/LocalLLaMA · 9 д назад · 1 просмотр

Huawei открыл исходный код openPangu-2.0-Pro, модели MoE на 505B-A18B

Huawei опубликовала веса с открытым исходным кодом для openPangu-2.0-Pro, большой языковой модели Mixture of Experts (MoE), обученной на оборудовании Ascend. Модель имеет 505 миллиардов общих параметров и 18 миллиардов активируемых параметров, а также поддерживает длину контекста в 512k токенов.

arxiv arXiv cs.CL · 9 д назад · 2 просмотра

Декодер памяти в масштабе: масштабирование параметрической долговременной памяти до 6,9 млрд параметров

Исследователи представляют Memory Decoder at Scale — систему, которая масштабирует параметрические модели долговременной памяти до 6,9 млрд параметров и предварительно обучает их на 300 млрд токенов. Чтобы решить проблему невозможности использования стандартных конвейеров Faiss при таком объёме данных, авторы реализуют распределённый конвейер индексации с разреженной пакетной загрузкой распределений kNN.

lab Microsoft Research Blog · 9 д назад · 3 просмотра

Microsoft Research представляет EvoLib для обучения во время тестирования с помощью эволюционирующей библиотеки

Microsoft Research представила EvoLib, фреймворк, который позволяет большим языковым моделям учиться на собственном опыте во время вывода без необходимости в метках ground-truth или внешней обратной связи. Вместо хранения сырого опыта в виде статической памяти EvoLib преобразует его в повторно используемые навыки и рефлексивные инсайты, которые постоянно уточняются, консолидируются и переобновляются.

lab Microsoft Research Blog · 9 д назад · 4 просмотра

Microsoft выпустила Echoverse для обучения агентов работы с компьютером

Microsoft Research выпустила Echoverse, набор из двенадцати глубоких синтетических сред, предназначенных для обучения агентов работы с компьютером. Инициатива включает десять специализированных миров и два мира, ориентированные на развитие навыков, все созданы для поддержания согласованного состояния и поведенческой точности.

arxiv arXiv cs.CL · 11 д назад

Relay-OPD сокращает длину траектории обучения более чем на 50% при дистилляции с использованием он-политики

Исследователи предлагают Relay On-Policy Distillation (Relay-OPD) для устранения проблемы отказа префикса в стандартной дистилляции с использованием он-политики, где ошибки студента приводят к ненадежной супервизии. Метод использует асимметрию продолжения между учителем и учеником как триггер для того, чтобы учитель на короткое время взял управление на себя и перенаправил траекторию, прежде чем ученик возобновит работу.

media r/LocalLLaMA · 12 д назад · 4 просмотра

Google предлагает дистилляцию Gemini как сервис

Google теперь предлагает службу дистилляции для своих моделей Gemini. Это позволяет пользователям сжимать возможности больших моделей Gemini в более компактные и эффективные версии через платформу Google Cloud.

arxiv arXiv cs.CL · 13 д назад OSWorld · 37.7%

OpenForgeRL позволяет проводить сквозное обучение агентов на основе хабров в любой среде

OpenForgeRL — это фреймворк с открытым исходным кодом, который позволяет исследователям обучать агентов ИИ на основе хабров от начала до конца с использованием стандартных стеков обучения с подкреплением. Он разделяет процессы обучения и вывода, используя легковесный прокси-сервер для записи вызовов модели в виде данных и оркестратор Kubernetes для управления развертываниями в удаленных контейнерах.

media Hugging Face Forums · 14 д назад GSM8K · 74.22%

CrowdTensor запускает бета-версию волонтёрского обучения и черновик RFC кампании Qwen2.5-7B GSM8K

CrowdTensor — это протокол с открытым исходным кодом Apache-2.0 для кампаний по обучению моделей волонтёрами с контрольными точками, который привязывает неизменяемые версии модели и данных, чтобы предоставить допущенным CPU, GPU или TPU ячейкам ограниченную работу. Проект выпустил процесс регистрации в бета-версии наряду с черновиком RFC для кампании Qwen2.5-7B GSM8K.

media Hugging Face Forums · 15 д назад

Выход ThetaScan v0.1: открытый скан-параллельный нелинейный механизм памяти с результатами для языковой модели на 17M параметров

Опубликована исследовательская превью-версия ThetaScan v0.1, механизма смешивания токенов с фиксированным состоянием и нелинейностью, в виде реализации с открытым исходным кодом. Архитектура гарантирует, что каждый токен вычисляет запись в память на основе текущего входа и общих параметров, а не эволюционирующего быстрого состояния, что позволяет записям комбинироваться через ассоциативный префиксный скан.

arxiv arXiv cs.CL · 16 д назад SWE-bench Pro · 55.9% · 2 просмотра

OpenForgeRL позволяет проводить сквозное обучение агентов на основе хайринга в любой среде

Исследователи представляют OpenForgeRL, фреймворк с открытым исходным кодом, который позволяет осуществлять сквозное обучение ИИ-агентов с использованием сложных инференс-хаингов, таких как Claude Code и OpenClaw. Система разделяет процесс обучения и вывода данных, используя легковесный прокси для записи вызовов модели в виде данных и оркестратор Kubernetes для управления развертыванием удаленных контейнеров.

arxiv arXiv cs.AI · 16 д назад OSWorld · 37.7% · 5 просмотров

OpenForgeRL позволяет проводить сквозное обучение агентов на основе хабров в любой среде

OpenForgeRL — это фреймворк с открытым исходным кодом, который позволяет исследователям обучать агентов ИИ на основе хабров от начала до конца с использованием стандартных стеков обучения с подкреплением. Это достигается за счёт разделения процессов обучения и вывода через лёгкий прокси-сервер, который записывает вызовы модели как данные, и оркестратора Kubernetes, управляющего удалённым развёртыванием контейнеров.

media Hugging Face Forums · 16 д назад · 1 просмотр

Обсуждение в сообществе о возможности использования доменных LLM на 7B–14B параметров в продакшене

Пользователь форума Hugging Face исследует, могут ли небольшие доменные большие языковые модели (LLM) с числом параметров от 7B до 14B эффективно заменять более крупные модели в реальных производственных средах.

media Hugging Face Forums · 17 д назад

ELIZA с разреженным автоэнкодером

Новая реализация чат-бота ELIZA использует архитектуру разреженного автоэнкодера для хранения записей разговора в слое латентной памяти, стремясь улучшить традиционные методы сопоставления ключевых слов. Система применяет структуру энкодер-декодер T5 с 32768-нейронным слоем памяти, где похожие записи активируются посредством контрастивного обучения.

media r/LocalLLaMA · 17 д назад · 1 просмотр

SLAI T-Rex достигает 34.22% MFU и 71.81% Pass@1 для DeepSeek-V4 на Ascend

SLAI представляет T-Rex, полнопараметрическую фреймворк постобучения для семейства моделей DeepSeek-V4 на инфраструктуре Ascend SuperPOD. Система решает проблемы давления памяти и накладных расходов на коммуникацию в триллионно-параметрических моделях MoE через иерархическую оптимизацию.

arxiv arXiv cs.AI · 17 д назад · 4 просмотра

SLAI T-Rex позволяет проводить полное параметрическое постобучение модели DeepSeek-V4 на платформе Ascend SuperPOD

SLAI представляет T-Rex — сквозную оптимизационную платформу для полного параметрического постобучения моделей MoE триллионного масштаба на суперкластере NPU Ascend. Используя семейство моделей DeepSeek-V4 в качестве целевой нагрузки, система решает проблемы с памятью и накладными расходами на коммуникацию за счёт иерархического параллелизма и оптимизации выполнения ядер.