Авторы представляют iLLaDA, 8-миллиардную языковую модель с маскированной диффузией, обученную с нуля с использованием полностью двунаправленного внимания. Этот подход контрастирует с преобладающим авторегрессионным факторизацией и каузальным вниманием, используемыми в современных больших языковых моделях. Предобучение модели масштабировалось до 12 триллионов токенов, за которыми последовало контролируемое тонкое настраивание (supervised fine-tuning) на корпусе инструкций объемом 25 миллиардов токенов в течение 12 эпох. iLLaDA сохраняет цель маскированной диффузии на обоих этапах обучения и использует генерацию переменной длины для повышения эффективности. Она также внедряет оценку на основе уверенности для улучшения результатов на задачах многократного выбора. Результаты бенчмарков показывают значительные улучшения по сравнению с ее предшественником, LLaDA, включая прирост на 21,6 балла на BBH и на 14,9 балла на ARC-Challenge для базовой модели. Вариант с инструкционным тонким настраиванием достиг увеличения на 14,5 балла на MATH и на 16,5 балла на HumanEval. Несмотря на неавторегрессионную природу, iLLaDA остается конкурентоспособной с Qwen2.5 7B по нескольким метрикам.
iLLaDA: 8-миллиардная языковая модель с маскированной диффузией и полностью двунаправленным вниманием
Бенчмарки
| Бенчмарк | Модель | Результат |
|---|---|---|
| ARC-AGI 1 | iLLaDA-Base | 14.9pts |
| HumanEval+ | iLLaDA-Instruct | 16.5pts |
Fathom-Vaidya улучшает медицинское рассуждение с помощью наград по рубрикам
Авторы представляют Fathom-Vaidya, модель с 30B параметров, которая использует синтетические данные и подкрепляющее обучение на основе рубрик для улучшения диагностического и клинического рассуждения в здравоохранении. Процесс обучения сначала применяет RL, управляемый правилами, к вопросам из MedBullets для диагностики, а затем использует 5.3k синтетических многошаговых сценариев с многомерными рубриками для интерактивных клинических задач.
Fathom-Vaidya улучшает медицинское рассуждение с помощью наград по рубрикам
Авторы представляют Fathom-Vaidya, модель с 30B параметров, которая использует синтетические данные и подкрепляющее обучение на основе рубрик для улучшения как диагностического, так и клинического медицинского рассуждения. Процесс обучения сначала направлен на повышение точности диагностики с использованием вопросов, полученных из MedBullets, а затем решает задачи многооборотного клинического взаимодействия через 5.3k сгенерированных сценариев с многомерными рубриками.
Fathom-Vaidya улучшает медицинское рассуждение с помощью наград по рубрикам
Авторы представляют Fathom-Vaidya, модель с 30B параметров, которая использует синтетические данные и подкрепляющее обучение, основанное на рубриках, для улучшения как диагностического, так и клинического рассуждения в здравоохранении.
MB-Bidram делится экспериментальной архитектурой WideNDepth, разделяющей рассуждение и знания
MB-Bidram выпустила экспериментальную нейронную архитектуру под названием WideNDepth (WND), предназначенную для разделения способностей к рассуждению и хранения знаний. Модель состоит из «Wide части», которая функционирует как память, и «Depth части», которая действует как механизм рассуждения.
Предложение: прогрессивная передача знаний от Qwen 9B к 27B для фиксированной модели на 4B
Пользователь на форумах Hugging Face предлагает эксперимент по прогрессивной передаче знаний, в котором студентская модель фиксированного размера (Qwen 4B) последовательно обучается у всё более крупных моделей-учителей, а не напрямую у самой большой из доступных.