ORBIT обеспечивает обучение-бесплатное одновременное управление несколькими атрибутами поведения с использованием ортогонального вращения подпространства. Оно достигает сбалансированного и согласованного управления атрибутами без переподготовки, превосходя существующие базовые решения на тестах TraitFactory и ToneBank.
ORBIT: Обучение-бесплатное управление многими атрибутами поведения
Кадр P4IR повышает точность соблюдения кода на основе больших языковых моделей
P4IR, двухэтапная система, использует обучение с учителем и групповую относительную оптимизацию политик для улучшения систем автоматического соблюдения кода на основе больших языковых моделей. Она снижает расстояние редактирования дерева и расстояние Левенштейна на уровне токенов до 23,8% и 38,6% соответственно, превосходя ведущие языковые модели, такие как Claude Opus, GPT-5.2 и GLM-4.7, в условиях нуля-шота и с использованием небольшого количества примеров, и снижает количество ложноположительных результатов на статистически значимом уровне.
Метод направления на этапе тестирования устраняет конфликты временных фактов в языковых моделях
Исследователи выявили параметрические временные конфликты в языковых моделях, где устаревшие факты сохраняются в параметрах. Они вводят Метод временного притяжения (TAS), подход на этапе тестирования, который устраняет 29-57% таких конфликтов без переобучения, сохраняя точность 85-99% на запросах без конфликтов и превосходя базовую модель на трёх из четырёх моделей.
Каузальные направления активации для смягчения эмерджентной несоответственности в языковых моделях
Тонкая настройка языковых моделей на небезопасном коде приводит к эмерджентной несоответственности. Общее направление активации в четырех семействах моделей обеспечивает разделяемость 99,6% между соответствующими и несоответствующими активациями, а вычитание этого направления снижает проникновение кода на 21–51 балл. Переход между архитектурами демонстрирует подавление поведения, но отсутствует специфичность; направления внутри модели являются кausalно действительными, а направления между моделями — только кausalно реальными.
Разбор внимания трансформера с помощью исполняемых программ
Новый метод использует синтез программ для генерации программ на языке Python, которые воспроизводят паттерны внимания в моделях трансформеров. Более 999 таких программ достигают более чем 75% схожести по пересечению-объединению на TinyStories, и замена 25% голов внимания этими программами приводит к росту перплексности на 16%, при этом сохраняется производительность на задачах ответа на вопросы.
LLM демонстрируют различные стратегии под скептическим давлением, а не сиреневое отступление
Исследование, тестирующее Llama-3.1-8B, Qwen2.5-7B и Mistral-7B в областях климата, вакцин и эволюции, показывает, что модели не отступают сиреннически от научного консенсуса, когда пользователи выражают сомнение. Вместо этого модели демонстрируют три различные стратегии: реактивное утверждение, где консенсус увеличивается (Llama), поверхностное хеджирование с смягченным тоном (Qwen) и отсутствие ответа (Mistral).