Независимый исследователь безопасности ИИ Кришнакант Редди Йедугуру запрашивает одобрение категории cs.CR на arXiv для статьи под названием «RedSOC — Фреймворк состязательной оценки для центров безопасности операций, интегрированных с LLM».
В исследовании представлены ключевые выводы, включая 100% уровень успешности атак (ASR) для косвенной инъекции промптов и 80% ASR для отравления корпуса данных. Кроме того, предложенный слой обнаружения показал 100% эффективность выявления в 15 сценариях и 10 независимых запусках без необходимости доступа к внутренним параметрам модели.
Автор предоставляет код одобрения (3RCVLY) для упрощения процесса рецензирования на arXiv.