独立AI安全研究员Krishnakaanth Reddy Yeduguru正在为题为“RedSOC — 面向LLM集成安全运营中心的对抗性评估框架”的论文申请arXiv cs.CR类别的背书。

该研究展示了关键发现,包括间接提示注入的攻击成功率(ASR)为100%,以及语料库投毒的ASR为80%。此外,所提出的检测层在15个场景和10次独立运行中实现了100%的检测率,且无需访问模型内部参数。

作者提供了一个背书代码(3RCVLY)以简化arXiv上的评审流程。