HydraHead вводит гибридное объединение полного и линейного внимания на уровне головок, используя интерпретируемость для выбора головок, критичных для поиска, и объединяя выходы через модуль с нормализацией масштаба. Обученный на 15 миллиардов токенов, он обеспечивает более чем 69% улучшения по сравнению с базовой моделью при длине контекста 512K, превосходя гибридные модели на уровне слоев и приближаясь к производительности Qwen3.5 на задачах с длинными контекстами.
HydraHead: гибридное внимание на уровне головок для производительности при длинных контекстах
МАСТ обеспечивает селективное исключение в процессе принятия решений, вызванного RLVR
МАСТ, механизм-ориентированный метод исключения, достигает целенаправленного забвения процесса принятия решений, вызванного RLVR, с минимальными побочными эффектами. На Qwen2.5-Math-1.5B и Qwen3-1.7B-Base он значительно снижает производительность MATH (45/150 до 37/15-0), при этом сохраняет точность GSM8K на +0.8 пунктов и поддерживает сохранение MATH на -0.5 пунктов. Результаты остаются стабильными при различных семенах, целях и моделях, демонстрируя превосходную стабильность по сравнению с полным исключением параметров.
МАСТ обеспечивает селективное исчезновение в процессе принятия решений, вызванных RLVR
МАСТ, метод селективного исчезновения, обеспечивает целенаправленное забвение процесса принятия решений, вызванного RLVR, с минимальными побочными эффектами. На Qwen2.5-Math-1.5B и Qwen3-1.7B-Base он значительно снижает производительность MATH (45/150 до 37/150), сохраняя точность GSM8K на +0.8 пунктов и поддерживая сохранение MATH на -0.5 пунктов. Результаты остаются стабильными при различных семенах, целях и моделях, демонстрируя превосходную стабильность по сравнению с полным исчезновением параметров.
ZPPO: Учитель в промптах, а не в градиентах
Зона проксимальной оптимизации политики (ZPPO) интегрирует знания учителя прямо в промпты, а не в градиенты политики. Используя двоичные и отрицательные кандидаты с включёнными вопросами, ZPPO выявляет недостатки учащихся и усиливает обучение через буфер повторного использования промптов, достигая превосходных результатов на сложных вопросах на различных масштабах учащихся, особенно при использовании малых моделей.
GSM-Plus-BN представляет бенчмарк на основе возмущений для математического рассуждения на бенгальском языке
Исследование представляет GSM-Plus-BN, новый набор данных по математике на бенгальском языке с возмущениями, полученный из английского бенчмарка GSM-Plus и проверенный переводчиками-людьми. Этот ресурс восполняет отсутствие системных бенчмарков для оценки устойчивости моделей в лингвистически разнообразных регионах, таких как Бангладеш.
CARE-PPO обеспечивает совместное обучение точным предсказаниям и надёжной уверенности в языковых количественных задачах
Исследователи представляют CARE-PPO, фреймворк обучения с подкреплением, который связывает прогнозирование потерь для оценки неопределённости с дообучением actor-critic PPO. Этот подход позволяет совместно обучать точным численным оценкам и надёжным сигналам уверенности при языковой количественной предсказательной задаче из неструктурированных входных данных.