Как безопасные LLM интерпретируют смешанные демонстрации соблюдения

Исследование показывает, что добровольные и вредоносные демонстрации соблюдения не являются взаимозаменяемыми в языковых моделях. Добровольные демонстрации могут либо снизить, либо увеличить вредоносное соблюдение в зависимости от модели, при этом оптимизация предпочтений играет ключевую роль в предотвращении вредоносного соблюдения. Исследование также выявило смещение в порядке демонстраций и разнообразные поведения моделей при обработке отказов в процессе в-контекстного обучения.