개발자 SecFathy는 XSS 취약점 분석을 위해 설계된 8B 보안 모델인 XSS Specialist라는 연구 프로토타입을 오픈소스로 공개했습니다. 이 프로젝트는 초기에 검색과 LoRA를 사용하여 전문화의 한계를 밀어붙이는 것을 목표로 했지만, 작은 식별자 변경이 잘못된 안전 판단을 초래하는 적대적 근접 실패 테스트에서 실패했기 때문에 결국 해당 모델을 거부했습니다.

  • 개발자는 추론과 사실 확립을 분리하고 확인 권한을 독립적인 실행 계층으로 이동하여 시스템을 재설계했습니다.
  • 잠재적 XSS 발견은 실제 헤드리스 브라우저가 안전한 센티넬을 실행할 때만 확인됩니다.
  • 동결된 102개 사례의 라이브 벤치마크에서 결과 아키텍처는 94.1%의 정밀도와 100%의 재현율, 그리고 영의 오탐지를 달성했습니다.
  • 코드, 아키텍처, 벤치마크 및 부정적 결과는 GitHub의 SecFathy/xss-specialist에서 사용할 수 있습니다.

저자는 신뢰할 수 있는 AI 시스템은 모델이 신뢰할 수 있도록 하는 것에만 의존하기보다는 모델이 잘못되었더라도 기능적으로 유지되도록 설계되어야 한다고 주장합니다.