Авторы предлагают метод Self-Aware Scheduling (SAS) для оптимизации порядка размаскирования токенов в маскированных диффузионных языковых моделях, что существенно влияет на качество генерации. Они выводят вычислимую верхнюю границу несоответствия последовательного декодирования с использованием расхождения Кульбака-Лейблера и логарифмического правдоподобия по траекториям. Эта граница формирует плотное вознаграждение, основанное на самоосознании, которое представляет выбор порядка как задачу оптимизации политики с замороженным денoiserом (denoiser). SAS обучает легковесную политику порядка с помощью Group Relative Policy Optimization, поддерживая как декодирование в любом порядке, так и полуавторегрессионное декодирование. На задачах судоку с моделью на 1 млрд параметров точность улучшилась с 82,0% до 91,8%, достигнув 97,5% после тонкой настройки второго этапа. Для математических рассуждений с LLaDA-8B метрика pass@1 на GSM8K увеличилась с 64% до 76%. Метод также повысил баллы MBPP с 39,5% до 41%, последовательно соответствуя или превосходя эвристические расписания при различных параметрах.
Самоосознающее планирование обучает порядку размаскирования токенов в диффузионных языковых моделях
Fathom-Vaidya улучшает медицинское рассуждение с помощью наград по рубрикам
Авторы представляют Fathom-Vaidya, модель с 30B параметров, которая использует синтетические данные и подкрепляющее обучение на основе рубрик для улучшения диагностического и клинического рассуждения в здравоохранении. Процесс обучения сначала применяет RL, управляемый правилами, к вопросам из MedBullets для диагностики, а затем использует 5.3k синтетических многошаговых сценариев с многомерными рубриками для интерактивных клинических задач.
Fathom-Vaidya улучшает медицинское рассуждение с помощью наград по рубрикам
Авторы представляют Fathom-Vaidya, модель с 30B параметров, которая использует синтетические данные и подкрепляющее обучение на основе рубрик для улучшения как диагностического, так и клинического медицинского рассуждения. Процесс обучения сначала направлен на повышение точности диагностики с использованием вопросов, полученных из MedBullets, а затем решает задачи многооборотного клинического взаимодействия через 5.3k сгенерированных сценариев с многомерными рубриками.
Fathom-Vaidya улучшает медицинское рассуждение с помощью наград по рубрикам
Авторы представляют Fathom-Vaidya, модель с 30B параметров, которая использует синтетические данные и подкрепляющее обучение, основанное на рубриках, для улучшения как диагностического, так и клинического рассуждения в здравоохранении.
MB-Bidram делится экспериментальной архитектурой WideNDepth, разделяющей рассуждение и знания
MB-Bidram выпустила экспериментальную нейронную архитектуру под названием WideNDepth (WND), предназначенную для разделения способностей к рассуждению и хранения знаний. Модель состоит из «Wide части», которая функционирует как память, и «Depth части», которая действует как механизм рассуждения.
Предложение: прогрессивная передача знаний от Qwen 9B к 27B для фиксированной модели на 4B
Пользователь на форумах Hugging Face предлагает эксперимент по прогрессивной передаче знаний, в котором студентская модель фиксированного размера (Qwen 4B) последовательно обучается у всё более крупных моделей-учителей, а не напрямую у самой большой из доступных.