AbdaullahAG와 Somia Abufakher는 아랍어, Arabizi, 영어에서 프롬프트 인젝션, 재일브레이크 및 개인정보 유출로부터 대규모 언어 모델을 보호하기 위해 설계된 오픈소스 4층 시맨틱 보안 게이트웨이인 SemGuard를 출시했습니다.
- 이 시스템은 유니코드 정규화, 서브밀리초 레지텍스트 빠른 검사 필터, 그리고 다국어-e5-large 임베딩을 사용하는 삼중 앵커 시맨틱 분류기를 포함한 캐스케이디드 파이프라인을 특징으로 합니다.
- SemGuard는 아랍어 프롬프트 공격에서 0.992 F1 점수를 달성하여 ProtectAI와 같은 베이스라인보다 +21.3 F1 포인트 더 우수하며 서브밀리초 지연 시간을 유지합니다.
- 저자들은 또한 7가지 위협 범주에 걸쳐 807개의 인간 및 LLM 검증 예제를 포함하는 SemGuard 벤치마크 데이터셋도 공개했습니다.
- 데이터셋의 주요 발견 중 하나는 최첨단 LLM이 아랍어에서 해로운 사칭과 양성 역할극을 구분할 때 98.2%의 시간 동안 의견 불일치를 보인다는 것입니다.
SemGuard는 차단되거나 허용된 요청에 대한 상세한 JSON 보고서를 출력함으로써 블랙박스 분류기에 대한 설명 가능한 대안을 제공하며, 자원이 부족한 언어에 대한 보안 격차를 해소합니다.