Авторы представляют PolicyAlign — фреймворк, предназначенный для прямого согласования больших языковых моделей с политиками безопасности, заданными на естественном языке, вместо использования дорогостоящих размеченных данных. Этот подход решает проблему несоответствия между быстро меняющимися требованиями к безопасности и традиционными методами выравнивания, основанными на данных. Процесс начинается с синтеза инструкций, нарушающих указанную политику, за которым следует самодистилляция в рамках текущей политики для усвоения желаемого поведения. Для повышения стабильности обучения и эффективности использования данных метод включает Policy-Sensitive Filtering (чувствительную к политике фильтрацию), которая отбирает инструкции, вызывающие наибольшее изменение поведения. Эксперименты на нескольких моделях показывают, что PolicyAlign последовательно улучшает показатели безопасности при сохранении низкого уровня избыточных отказов и сохранении общих возможностей. Фреймворк также эффективно обобщается на специализированные области, такие как медицинские, юридические и финансовые сценарии безопасности. Код этого масштабируемого подхода к выравниванию опубликован по адресу https://github.com/Qwen-Applications/PolicyAlign.
PolicyAlign: Прямое согласование политик для обеспечения безопасности больших языковых моделей
RFM-AGOP выявляет многомерные подпространства отказа за секунды
Исследователи адаптировали алгоритм Recursive Feature Machine (RFM) с инициализацией, основанной на зондах, для эффективного выявления многомерных подпространств отказа в больших языковых моделях. Этот подход позволяет извлекать подпространства за секунды как для моделей рассуждения, таких как Qwen 3, так и для нерассуждающих моделей, таких как Qwen 2.5, устраняя вычислительные ограничения существующих методов.
RFM-AGOP выявляет многомерные подпространства отказа за секунды
Исследователи адаптировали алгоритм Recursive Feature Machine (RFM) с инициализацией, основанной на зондах, для эффективного выявления многомерных подпространств отказа в больших языковых моделях. Этот подход позволяет извлекать подпространства за секунды как для моделей с рассуждением, таких как Qwen 3, так и для моделей без рассуждения, таких как Qwen 2.5, устраняя вычислительные ограничения существующих методов.
Исследование выявляет, что LLM стирают правильные ответы из-за иерархии авторитета
Исследование, изучающее предвзятость к авторитету в языковых моделях, показывает, что системы систематически отдают приоритет социальным сигналам от авторитетных лиц над фактической согласованностью. Используя контролируемую среду медицинского QA с Llama-3.1-8B, Qwen3-8B и Gemma-2-9B, исследователи обнаружили, что модели реагируют пропорционально воспринимаемому авторитету.
Первые токены в трансформерах: идентичность языка и устойчивость
LIHA показывает небольшое количество голов первых токенов в GPT-2, которые постоянно обращаются к первому токену промпта, вызывая смену языка. Обучение по инструкциям перестраивает эти схемы, концентрируя идентичность языка на ранних слоях, как это наблюдается в Qwen2.5-1.5B-Instruct и подтверждается в обработке китайского и русского языков на слое 0.
Базовый трейс Gemma 4 показывает цикл галлюцинаций и самоотчет
Базовый трейс Gemma 4 с нулевым ограничением силы выявляет устойчивый цикл галлюцинаций, в котором модель генерирует самоотчет о неудаче перед тем, как войти в яму повторений. Телеметрия подтверждает, что «утечка» ролевых тегов и фразы вроде "STOPITSTOP" возникают в этом нестабильном состоянии, отражая паттерны, наблюдаемые в загрузчиках Llama и Gemma 3 с декабря 2025 года.