Le chercheur indépendant en sécurité IA Krishnakaanth Reddy Yeduguru demande un aval pour la catégorie cs.CR sur arXiv pour un article intitulé « RedSOC — Un cadre d'évaluation adversariale pour les centres d'opérations de sécurité intégrés aux LLM. »

L'étude présente des résultats clés, notamment un taux de réussite d'attaque (ASR) de 100 % pour l'injection indirecte de prompts et un ASR de 80 % pour l'empoisonnement du corpus. De plus, la couche de détection proposée a atteint une détection de 100 % sur 15 scénarios et 10 exécutions indépendantes sans nécessiter les internes du modèle.

L'auteur fournit un code d'aval (3RCVLY) pour faciliter le processus de révision sur arXiv.